~/about

Sobre mí

Richard Feng — ingeniero de web scraping con más de 12 años de experiencia. Convierto sitios web protegidos en datos estructurados limpios y listos para RAG para agentes de IA, pipelines de recuperación y LLMs.

Quién soy

Soy Richard Feng, ingeniero freelance de automatización web con más de 12 años de experiencia programando. Me especializo en web scraping, extracción de datos e ingeniería inversa de APIs: convierto sitios web complejos y protegidos en datos estructurados y limpios que los sistemas de IA realmente pueden usar.

Mi caja de herramientas abarca Node.js (TypeScript), Python, Go y Java, con experiencia profunda en Crawlee, Playwright y Cheerio. He construido sistemas en producción que gestionan millones de solicitudes con un >99% de éxito.

Qué hago

Desarrollo y mantengo 16 Apify Actors de nivel de producción que dan servicio a más de 3,100 usuarios con una tasa de éxito constante del >99% por ejecución. Cada actor genera JSON limpio y listo para RAG: consistente en su esquema, deduplicado y listo para cargar en un vector store, un pipeline de recuperación o un conjunto de entrenamiento. La mayoría de los actores de datos públicos no requieren clave API. Mi trabajo abarca cuatro áreas:

Datos de e-commerce y retail

Scrapers para las principales plataformas de belleza y moda, incluyendo Sephora (21 tiendas en todo el mundo), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, y un scraper universal de Shopify que funciona con cualquier tienda basada en Shopify.

Datos públicos, financieros y legales

Datasets oficiales de EE. UU. como JSON limpio y listo para RAG — informes SEC EDGAR y datos financieros XBRL, adjudicaciones federales de USAspending.gov, sentencias judiciales de CourtListener y estudios de ClinicalTrials.gov.

Inteligencia social y de medios

Posts, perfiles e interacciones de Bluesky vía AT Protocol, además de un scraper de subtítulos y transcripciones de YouTube que genera JSON, SRT, VTT o texto listo para LLM en más de 100 idiomas.

Utilidades para desarrolladores

Herramientas más allá del scraping — auditoría de SEO y datos estructurados, renderizado de web a PDF/imagen y pruebas de carga de alto rendimiento.

Especialidades

  • Ingeniería inversa de APIs privadas — convierto endpoints móviles/web no documentados en fuentes de datos fiables
  • Evasión anti-bot — Cloudflare, DataDome, Akamai WAF y protecciones personalizadas
  • Salida lista para RAG — JSON normalizado y con esquema consistente, pensado para recuperación y fundamentación
  • Scraping multirregión — locales, monedas y cumplimiento normativo resueltos
  • Sistemas de alta fiabilidad — extractores que mantienen un >99% de éxito a gran escala

Stack tecnológico

CategoríaTecnologías
LenguajesTypeScript, Python, Go, Java
ScrapingCrawlee, Playwright, Cheerio, Parsel, got-scraping
Anti-botGeneradores de huellas digitales, huella digital TLS, rotación de sesiones
InfraestructuraApify Platform, Docker, GitHub Actions
PruebasVegeta, frameworks de pruebas de carga personalizados

Trabaja conmigo

Ofrezco soluciones de scraping a medida, ingeniería de pipelines de datos RAG y servicios continuos de extracción de datos. Si tu IA necesita la web real convertida en datos limpios — hablemos.