<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Proooxy — Datos web listos para RAG para agentes de IA y LLM</title><link>https://proooxy.com/es/</link><description>Recent content on Proooxy — Datos web listos para RAG para agentes de IA y LLM</description><generator>Hugo</generator><language>es</language><lastBuildDate>Wed, 15 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://proooxy.com/es/index.xml" rel="self" type="application/rss+xml"/><item><title>Scraper de Macy's — Productos, precios, SKUs y noticias</title><link>https://proooxy.com/es/tools/macys-scraper/</link><pubDate>Wed, 15 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/macys-scraper/</guid><description>Productos, precios, SKUs/UPCs y noticias de Macy&amp;rsquo;s — a prueba de Akamai, sin navegador.</description></item><item><title>Scraper de Bluesky — Posts, perfiles, feeds e interacciones</title><link>https://proooxy.com/es/tools/bluesky-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/bluesky-scraper/</guid><description>Extrae posts, perfiles, feeds e interacciones de Bluesky.</description></item><item><title>Scraper de ClinicalTrials.gov — Estudios, elegibilidad y resultados</title><link>https://proooxy.com/es/tools/clinical-trials-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/clinical-trials-scraper/</guid><description>Busca estudios, elegibilidad y resultados en ClinicalTrials.gov.</description></item><item><title>Scraper de CourtListener — Sentencias, expedientes y texto completo</title><link>https://proooxy.com/es/tools/courtlistener-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/courtlistener-scraper/</guid><description>Jurisprudencia de EE. UU., expedientes y texto completo de sentencias para IA legal.</description></item><item><title>Scraper de SEC EDGAR — Informes, texto completo y datos financieros XBRL</title><link>https://proooxy.com/es/tools/sec-edgar-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/sec-edgar-scraper/</guid><description>Informes SEC, texto de 10-K/10-Q y datos financieros XBRL — listos para RAG.</description></item><item><title>Scraper de subtítulos y transcripciones de YouTube — JSON, SRT, VTT, LLM</title><link>https://proooxy.com/es/tools/youtube-transcript-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/youtube-transcript-scraper/</guid><description>Transcripciones de YouTube en JSON, SRT, VTT o texto listo para LLM.</description></item><item><title>Scraper de USAspending.gov — Adjudicaciones federales, beneficiarios y agregados</title><link>https://proooxy.com/es/tools/usaspending-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/usaspending-scraper/</guid><description>Adjudicaciones federales, beneficiarios y agregados de gasto de USAspending.gov.</description></item><item><title>Scraper de Sephora (Global)</title><link>https://proooxy.com/es/tools/sephora-scraper/</link><pubDate>Sat, 18 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/sephora-scraper/</guid><description>Extrae datos de cualquier tienda de Sephora — 21 mercados, un solo actor.</description></item><item><title>Global API Load Tester — Prueba de estrés de 10K+ RPS</title><link>https://proooxy.com/es/tools/load-tester/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/load-tester/</guid><description>Simula más de 10K RPS con pruebas de carga geodistribuidas.</description></item><item><title>Scraper de Boohoo — Datos de producto en 7 regiones</title><link>https://proooxy.com/es/tools/boohoo-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/boohoo-scraper/</guid><description>Extrae datos de producto de Boohoo en 7 tiendas regionales.</description></item><item><title>Scraper de Farfetch — Datos de producto de moda de lujo</title><link>https://proooxy.com/es/tools/farfetch-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/farfetch-scraper/</guid><description>Extrae productos de moda de lujo de Farfetch con soporte multidivisa.</description></item><item><title>Scraper de Lululemon — Productos, variantes y precios</title><link>https://proooxy.com/es/tools/lululemon-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/lululemon-scraper/</guid><description>Extrae datos de producto con variantes y contenido multimedia de Lululemon.</description></item><item><title>Scraper de Schema Markup y auditor SEO</title><link>https://proooxy.com/es/tools/schema-markup-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/schema-markup-scraper/</guid><description>Extrae datos estructurados y audita el SEO de cualquier sitio web.</description></item><item><title>Scraper de Sephora EU — 9 mercados europeos</title><link>https://proooxy.com/es/tools/sephora-eu-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/sephora-eu-scraper/</guid><description>Extrae datos de producto de Sephora en 9 mercados europeos.</description></item><item><title>Scraper de Shopify — Datos de producto de cualquier tienda</title><link>https://proooxy.com/es/tools/shopify-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/shopify-scraper/</guid><description>Extrae datos de producto de cualquier tienda Shopify.</description></item><item><title>Scraper de Ulta Beauty — Productos, precios y SKUs</title><link>https://proooxy.com/es/tools/ulta-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/ulta-scraper/</guid><description>Extrae datos completos de producto de Ulta Beauty.</description></item><item><title>Universal Web Printer — URL y HTML a PDF, imagen</title><link>https://proooxy.com/es/tools/web-printer/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/tools/web-printer/</guid><description>Convierte URLs y HTML a PDF, PNG, JPEG o WebP.</description></item><item><title>Buenas prácticas de web scraping en 2026: guía de un profesional</title><link>https://proooxy.com/es/blog/web-scraping-best-practices-2026/</link><pubDate>Wed, 01 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/blog/web-scraping-best-practices-2026/</guid><description>&lt;p&gt;Después de construir y mantener 15 scrapers de producción que dan servicio a más de 3,100 usuarios con tasas de éxito del &amp;gt;99%, estas son las prácticas que realmente importan.&lt;/p&gt;
&lt;h2 id="arquitectura-piensa-en-pipelines-no-en-scripts"&gt;Arquitectura: piensa en pipelines, no en scripts&lt;/h2&gt;
&lt;p&gt;El error más grande que veo es tratar el scraping como un proceso de un solo paso. Los scrapers de producción son pipelines de datos:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Descubrimiento de URLs&lt;/strong&gt; — encontrar qué extraer (sitemaps, páginas de categoría, búsqueda, APIs)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Ejecución de solicitudes&lt;/strong&gt; — obtener los datos con reintentos y rotación adecuados&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Parseo&lt;/strong&gt; — extraer campos estructurados de las respuestas en bruto&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Normalización&lt;/strong&gt; — limpiar, validar y estandarizar la salida&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Almacenamiento&lt;/strong&gt; — enviar a datasets, bases de datos o sistemas posteriores&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Cada paso debe poder probarse y reintentarse de forma independiente. Cuando Sephora cambia el diseño de su página de producto, solo el paso 3 necesita actualizarse — el resto del pipeline se mantiene estable.&lt;/p&gt;</description></item><item><title>Entendiendo la protección anti-bot: qué funciona en 2026</title><link>https://proooxy.com/es/blog/bypassing-anti-bot-protection-guide/</link><pubDate>Sun, 15 Mar 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/blog/bypassing-anti-bot-protection-guide/</guid><description>&lt;p&gt;La protección anti-bot es una carrera armamentista. Como alguien que construye scrapers de producción que evaden estos sistemas a diario, esta es la visión de un profesional sobre el panorama actual: qué comprueban realmente estas protecciones y cómo son las técnicas legítimas de evasión.&lt;/p&gt;
&lt;h2 id="las-capas-de-detección"&gt;Las capas de detección&lt;/h2&gt;
&lt;p&gt;Los sistemas anti-bot modernos operan en capas. Entender estas capas es la clave para lograr una evasión fiable:&lt;/p&gt;
&lt;h3 id="capa-1-reputación-de-ip"&gt;Capa 1: Reputación de IP&lt;/h3&gt;
&lt;p&gt;La comprobación más simple. Los servicios anti-bot mantienen bases de datos de rangos de IP de centros de datos conocidos, salidas de VPN e IPs marcadas previamente.&lt;/p&gt;</description></item><item><title>Contacto</title><link>https://proooxy.com/es/contact/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/contact/</guid><description>&lt;h2 id="consigue-datos-que-no-están-en-el-catálogo"&gt;Consigue datos que no están en el catálogo&lt;/h2&gt;
&lt;p&gt;Construyo scrapers a medida y pipelines de datos RAG — para equipos de IA, plataformas de datos y cualquiera que necesite la web abierta convertida en JSON limpio y estructurado. Ya sea una extracción puntual o un feed que se actualiza continuamente, puedo ayudarte.&lt;/p&gt;
&lt;h3 id="qué-construyo"&gt;Qué construyo&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Scrapers a medida&lt;/strong&gt; — diseñados específicamente para tus sitios objetivo, con evasión anti-bot integrada de fábrica&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Pipelines de datos RAG&lt;/strong&gt; — extraigo, normalizo, fragmento y entrego JSON listo para recuperación a tu vector store o warehouse&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Ingeniería inversa de APIs privadas&lt;/strong&gt; — convierto endpoints móviles/web no documentados en fuentes estables y estructuradas&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Mantenimiento de scrapers&lt;/strong&gt; — mantengo vivos tus extractores existentes cuando los sitios objetivo cambian&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Consultoría técnica&lt;/strong&gt; — revisión de arquitectura para tu stack de scraping e ingesta de datos&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="cómo-funciona"&gt;Cómo funciona&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Describe los datos&lt;/strong&gt; — la fuente, los campos que necesitas y el formato de entrega&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Estudio de viabilidad gratuito&lt;/strong&gt; — evalúo la complejidad del objetivo y su nivel de protección anti-bot sin coste&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Propuesta y cronograma&lt;/strong&gt; — alcance claro, precio fijo, fecha de entrega&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Construcción y entrega&lt;/strong&gt; — extractor de nivel de producción con documentación y salida limpia&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="inicia-un-proyecto"&gt;Inicia un proyecto&lt;/h3&gt;
&lt;form action="https://api.web3forms.com/submit" method="POST" class="form contact-form"&gt;
 &lt;input type="hidden" name="access_key" value="9ed3e6ad-95b9-46d5-b3f7-3ffd428d9c3a"&gt;
 &lt;div class="field"&gt;
 &lt;label for="name"&gt;nombre&lt;/label&gt;
 &lt;input type="text" name="name" id="name" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="email"&gt;email&lt;/label&gt;
 &lt;input type="email" name="email" id="email" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="project"&gt;tipo de proyecto&lt;/label&gt;
 &lt;select name="project" id="project"&gt;
 &lt;option value="custom-scraper"&gt;Scraper a medida&lt;/option&gt;
 &lt;option value="rag-pipeline"&gt;Pipeline de datos RAG&lt;/option&gt;
 &lt;option value="api-reverse-engineering"&gt;Ingeniería inversa de API privada&lt;/option&gt;
 &lt;option value="consulting"&gt;Consultoría técnica&lt;/option&gt;
 &lt;option value="other"&gt;Otro&lt;/option&gt;
 &lt;/select&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="message"&gt;¿qué necesitas?&lt;/label&gt;
 &lt;textarea name="message" id="message" rows="5" required&gt;&lt;/textarea&gt;
 &lt;/div&gt;
 &lt;button type="submit" class="btn btn--primary btn--lg"&gt;enviar mensaje&lt;/button&gt;
&lt;/form&gt;
&lt;h3 id="o-contáctame-directamente"&gt;O contáctame directamente&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Email&lt;/strong&gt;: &lt;a href="mailto:p8p9cmk96@mozmail.com"&gt;p8p9cmk96@mozmail.com&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GitHub&lt;/strong&gt;: &lt;a href="https://github.com/autofacts"&gt;@autofacts&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Apify&lt;/strong&gt;: &lt;a href="https://apify.com/autofacts"&gt;apify.com/autofacts&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Sobre mí</title><link>https://proooxy.com/es/about/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/es/about/</guid><description>&lt;h2 id="quién-soy"&gt;Quién soy&lt;/h2&gt;
&lt;p&gt;Soy Richard Feng, ingeniero freelance de automatización web con más de 12 años de experiencia programando. Me especializo en &lt;strong&gt;web scraping, extracción de datos e ingeniería inversa de APIs&lt;/strong&gt;: convierto sitios web complejos y protegidos en datos estructurados y limpios que los sistemas de IA realmente pueden usar.&lt;/p&gt;
&lt;p&gt;Mi caja de herramientas abarca &lt;strong&gt;Node.js (TypeScript), Python, Go y Java&lt;/strong&gt;, con experiencia profunda en &lt;strong&gt;Crawlee, Playwright y Cheerio&lt;/strong&gt;. He construido sistemas en producción que gestionan millones de solicitudes con un &lt;strong&gt;&amp;gt;99% de éxito&lt;/strong&gt;.&lt;/p&gt;</description></item></channel></rss>