~/about

Sobre

Richard Feng — engenheiro de web scraping com mais de 12 anos de experiência. Transformo sites protegidos em dados estruturados, limpos e prontos para RAG para agentes de IA, pipelines de recuperação e LLMs.

Quem eu sou

Sou Richard Feng, engenheiro freelancer de automação web com mais de 12 anos de experiência em programação. Sou especializado em web scraping, extração de dados e engenharia reversa de APIs — transformando sites complexos e protegidos em dados limpos e estruturados que sistemas de IA realmente conseguem usar.

Meu conjunto de ferramentas abrange Node.js (TypeScript), Python, Go e Java, com profundo conhecimento em Crawlee, Playwright e Cheerio. Já construí sistemas de produção que processam milhões de requisições com >99% de sucesso.

O que eu faço

Desenvolvo e mantenho 16 atores Apify de nível de produção que atendem mais de 3,100 usuários com uma taxa consistente de >99% de sucesso nas execuções. Cada ator gera JSON limpo e pronto para RAG — com esquema consistente, deduplicado e pronto para uso em um vector store, pipeline de recuperação ou conjunto de treinamento. A maioria dos atores de dados públicos não exige chave de API. Meu trabalho abrange quatro áreas:

Dados de e-commerce e varejo

Scrapers para as principais plataformas de beleza e moda, incluindo Sephora (21 lojas ao redor do mundo), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, e um scraper universal para Shopify que funciona com qualquer loja baseada em Shopify.

Dados públicos, financeiros e jurídicos

Datasets oficiais dos EUA em JSON limpo e pronto para RAG — arquivos SEC EDGAR e dados financeiros XBRL, concessões federais do USAspending.gov, decisões judiciais do CourtListener, e estudos do ClinicalTrials.gov.

Inteligência de redes sociais e mídia

Posts, perfis e interações do Bluesky via AT Protocol, além de um scraper de legendas e transcrições do YouTube que gera JSON, SRT, VTT ou texto pronto para LLM em mais de 100 idiomas.

Utilitários para desenvolvedores

Ferramentas além do scraping — auditoria de SEO e dados estruturados, renderização de páginas em PDF/imagem, e testes de carga de alta performance.

Especialidades

  • Engenharia reversa de APIs privadas — transformando endpoints não documentados de mobile/web em fontes de dados confiáveis
  • Bypass de anti-bot — Cloudflare, DataDome, Akamai WAF e proteções personalizadas
  • Saída pronta para RAG — JSON normalizado e com esquema consistente, construído para recuperação e grounding
  • Scraping multi-região — locales, moedas e compliance sob controle
  • Sistemas de alta confiabilidade — extratores que mantêm >99% de sucesso em escala

Stack técnica

CategoriaTecnologias
LinguagensTypeScript, Python, Go, Java
ScrapingCrawlee, Playwright, Cheerio, Parsel, got-scraping
Anti-botFingerprint generators, TLS fingerprinting, session rotation
InfraestruturaApify Platform, Docker, GitHub Actions
TestesVegeta, custom load-testing frameworks

Trabalhe comigo

Ofereço soluções de scraping sob medida, engenharia de pipelines de dados para RAG e serviços contínuos de extração de dados. Se a sua IA precisa da web real como dados limpos — vamos conversar.