Sobre mí
Richard Feng — ingeniero de web scraping con más de 12 años de experiencia. Convierto sitios web protegidos en datos estructurados limpios y listos para RAG para agentes de IA, pipelines de recuperación y LLMs.
Quién soy
Soy Richard Feng, ingeniero freelance de automatización web con más de 12 años de experiencia programando. Me especializo en web scraping, extracción de datos e ingeniería inversa de APIs: convierto sitios web complejos y protegidos en datos estructurados y limpios que los sistemas de IA realmente pueden usar.
Mi caja de herramientas abarca Node.js (TypeScript), Python, Go y Java, con experiencia profunda en Crawlee, Playwright y Cheerio. He construido sistemas en producción que gestionan millones de solicitudes con un >99% de éxito.
Qué hago
Desarrollo y mantengo 16 Apify Actors de nivel de producción que dan servicio a más de 3,100 usuarios con una tasa de éxito constante del >99% por ejecución. Cada actor genera JSON limpio y listo para RAG: consistente en su esquema, deduplicado y listo para cargar en un vector store, un pipeline de recuperación o un conjunto de entrenamiento. La mayoría de los actores de datos públicos no requieren clave API. Mi trabajo abarca cuatro áreas:
Datos de e-commerce y retail
Scrapers para las principales plataformas de belleza y moda, incluyendo Sephora (21 tiendas en todo el mundo), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, y un scraper universal de Shopify que funciona con cualquier tienda basada en Shopify.
Datos públicos, financieros y legales
Datasets oficiales de EE. UU. como JSON limpio y listo para RAG — informes SEC EDGAR y datos financieros XBRL, adjudicaciones federales de USAspending.gov, sentencias judiciales de CourtListener y estudios de ClinicalTrials.gov.
Inteligencia social y de medios
Posts, perfiles e interacciones de Bluesky vía AT Protocol, además de un scraper de subtítulos y transcripciones de YouTube que genera JSON, SRT, VTT o texto listo para LLM en más de 100 idiomas.
Utilidades para desarrolladores
Herramientas más allá del scraping — auditoría de SEO y datos estructurados, renderizado de web a PDF/imagen y pruebas de carga de alto rendimiento.
Especialidades
- Ingeniería inversa de APIs privadas — convierto endpoints móviles/web no documentados en fuentes de datos fiables
- Evasión anti-bot — Cloudflare, DataDome, Akamai WAF y protecciones personalizadas
- Salida lista para RAG — JSON normalizado y con esquema consistente, pensado para recuperación y fundamentación
- Scraping multirregión — locales, monedas y cumplimiento normativo resueltos
- Sistemas de alta fiabilidad — extractores que mantienen un >99% de éxito a gran escala
Stack tecnológico
| Categoría | Tecnologías |
|---|---|
| Lenguajes | TypeScript, Python, Go, Java |
| Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| Anti-bot | Generadores de huellas digitales, huella digital TLS, rotación de sesiones |
| Infraestructura | Apify Platform, Docker, GitHub Actions |
| Pruebas | Vegeta, frameworks de pruebas de carga personalizados |
Trabaja conmigo
Ofrezco soluciones de scraping a medida, ingeniería de pipelines de datos RAG y servicios continuos de extracción de datos. Si tu IA necesita la web real convertida en datos limpios — hablemos.