Sobre
Richard Feng — engenheiro de web scraping com mais de 12 anos de experiência. Transformo sites protegidos em dados estruturados, limpos e prontos para RAG para agentes de IA, pipelines de recuperação e LLMs.
Quem eu sou
Sou Richard Feng, engenheiro freelancer de automação web com mais de 12 anos de experiência em programação. Sou especializado em web scraping, extração de dados e engenharia reversa de APIs — transformando sites complexos e protegidos em dados limpos e estruturados que sistemas de IA realmente conseguem usar.
Meu conjunto de ferramentas abrange Node.js (TypeScript), Python, Go e Java, com profundo conhecimento em Crawlee, Playwright e Cheerio. Já construí sistemas de produção que processam milhões de requisições com >99% de sucesso.
O que eu faço
Desenvolvo e mantenho 16 atores Apify de nível de produção que atendem mais de 3,100 usuários com uma taxa consistente de >99% de sucesso nas execuções. Cada ator gera JSON limpo e pronto para RAG — com esquema consistente, deduplicado e pronto para uso em um vector store, pipeline de recuperação ou conjunto de treinamento. A maioria dos atores de dados públicos não exige chave de API. Meu trabalho abrange quatro áreas:
Dados de e-commerce e varejo
Scrapers para as principais plataformas de beleza e moda, incluindo Sephora (21 lojas ao redor do mundo), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, e um scraper universal para Shopify que funciona com qualquer loja baseada em Shopify.
Dados públicos, financeiros e jurídicos
Datasets oficiais dos EUA em JSON limpo e pronto para RAG — arquivos SEC EDGAR e dados financeiros XBRL, concessões federais do USAspending.gov, decisões judiciais do CourtListener, e estudos do ClinicalTrials.gov.
Inteligência de redes sociais e mídia
Posts, perfis e interações do Bluesky via AT Protocol, além de um scraper de legendas e transcrições do YouTube que gera JSON, SRT, VTT ou texto pronto para LLM em mais de 100 idiomas.
Utilitários para desenvolvedores
Ferramentas além do scraping — auditoria de SEO e dados estruturados, renderização de páginas em PDF/imagem, e testes de carga de alta performance.
Especialidades
- Engenharia reversa de APIs privadas — transformando endpoints não documentados de mobile/web em fontes de dados confiáveis
- Bypass de anti-bot — Cloudflare, DataDome, Akamai WAF e proteções personalizadas
- Saída pronta para RAG — JSON normalizado e com esquema consistente, construído para recuperação e grounding
- Scraping multi-região — locales, moedas e compliance sob controle
- Sistemas de alta confiabilidade — extratores que mantêm >99% de sucesso em escala
Stack técnica
| Categoria | Tecnologias |
|---|---|
| Linguagens | TypeScript, Python, Go, Java |
| Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| Anti-bot | Fingerprint generators, TLS fingerprinting, session rotation |
| Infraestrutura | Apify Platform, Docker, GitHub Actions |
| Testes | Vegeta, custom load-testing frameworks |
Trabalhe comigo
Ofereço soluções de scraping sob medida, engenharia de pipelines de dados para RAG e serviços contínuos de extração de dados. Se a sua IA precisa da web real como dados limpos — vamos conversar.