<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Proooxy — Dados web prontos para RAG para agentes de IA e LLMs</title><link>https://proooxy.com/pt/</link><description>Recent content on Proooxy — Dados web prontos para RAG para agentes de IA e LLMs</description><generator>Hugo</generator><language>pt-BR</language><lastBuildDate>Wed, 15 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://proooxy.com/pt/index.xml" rel="self" type="application/rss+xml"/><item><title>Macy's Scraper — Produtos, Preços, SKUs e Notícias</title><link>https://proooxy.com/pt/tools/macys-scraper/</link><pubDate>Wed, 15 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/macys-scraper/</guid><description>Produtos, preços, SKUs/UPCs e notícias da Macy&amp;rsquo;s — à prova de Akamai, sem navegador.</description></item><item><title>Bluesky Scraper — Posts, Perfis, Feeds e Interações</title><link>https://proooxy.com/pt/tools/bluesky-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/bluesky-scraper/</guid><description>Extraia posts, perfis, feeds e interações do Bluesky.</description></item><item><title>ClinicalTrials.gov Scraper — Estudos, Elegibilidade e Resultados</title><link>https://proooxy.com/pt/tools/clinical-trials-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/clinical-trials-scraper/</guid><description>Pesquise estudos, elegibilidade e resultados no ClinicalTrials.gov.</description></item><item><title>CourtListener Scraper — Decisões, Processos e Texto Completo</title><link>https://proooxy.com/pt/tools/courtlistener-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/courtlistener-scraper/</guid><description>Jurisprudência dos EUA, processos e texto completo de decisões para IA jurídica.</description></item><item><title>SEC EDGAR Scraper — Arquivos, Texto Completo e Dados Financeiros XBRL</title><link>https://proooxy.com/pt/tools/sec-edgar-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/sec-edgar-scraper/</guid><description>Arquivos da SEC, texto de 10-K/10-Q e dados financeiros XBRL — prontos para RAG.</description></item><item><title>USAspending.gov Scraper — Concessões Federais, Beneficiários e Agregados</title><link>https://proooxy.com/pt/tools/usaspending-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/usaspending-scraper/</guid><description>Concessões federais, beneficiários e agregados de gastos do USAspending.gov.</description></item><item><title>YouTube Subtitle &amp; Transcript Scraper — JSON, SRT, VTT, LLM</title><link>https://proooxy.com/pt/tools/youtube-transcript-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/youtube-transcript-scraper/</guid><description>Transcrições do YouTube em JSON, SRT, VTT ou texto pronto para LLM.</description></item><item><title>Sephora Scraper (Global)</title><link>https://proooxy.com/pt/tools/sephora-scraper/</link><pubDate>Sat, 18 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/sephora-scraper/</guid><description>Extraia dados de qualquer loja Sephora — 21 mercados, um único ator.</description></item><item><title>Boohoo Scraper — Dados de Produtos em 7 Regiões</title><link>https://proooxy.com/pt/tools/boohoo-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/boohoo-scraper/</guid><description>Extraia dados de produtos da Boohoo em 7 lojas regionais.</description></item><item><title>Farfetch Scraper — Dados de Produtos de Moda de Luxo</title><link>https://proooxy.com/pt/tools/farfetch-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/farfetch-scraper/</guid><description>Extraia produtos de moda de luxo da Farfetch com suporte a múltiplas moedas.</description></item><item><title>Global API Load Tester — Teste de Carga de 10K+ RPS</title><link>https://proooxy.com/pt/tools/load-tester/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/load-tester/</guid><description>Simule 10K+ RPS com testes de carga geodistribuídos.</description></item><item><title>Lululemon Scraper — Produtos, Variantes e Preços</title><link>https://proooxy.com/pt/tools/lululemon-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/lululemon-scraper/</guid><description>Extraia dados de produtos com variantes e mídia da Lululemon.</description></item><item><title>Schema Markup Scraper e Auditor de SEO</title><link>https://proooxy.com/pt/tools/schema-markup-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/schema-markup-scraper/</guid><description>Extraia dados estruturados e audite o SEO de qualquer site.</description></item><item><title>Sephora EU Scraper — 9 Mercados Europeus</title><link>https://proooxy.com/pt/tools/sephora-eu-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/sephora-eu-scraper/</guid><description>Extraia dados de produtos da Sephora em 9 mercados europeus.</description></item><item><title>Shopify Scraper — Dados de Produtos de Qualquer Loja</title><link>https://proooxy.com/pt/tools/shopify-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/shopify-scraper/</guid><description>Extraia dados de produtos de qualquer loja Shopify.</description></item><item><title>Ulta Beauty Scraper — Produtos, Preços e SKUs</title><link>https://proooxy.com/pt/tools/ulta-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/ulta-scraper/</guid><description>Extraia dados completos de produtos da Ulta Beauty.</description></item><item><title>Universal Web Printer — URL e HTML para PDF, Imagem</title><link>https://proooxy.com/pt/tools/web-printer/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/tools/web-printer/</guid><description>Converta URLs e HTML em PDF, PNG, JPEG ou WebP.</description></item><item><title>Boas Práticas de Web Scraping em 2026: Um Guia Prático</title><link>https://proooxy.com/pt/blog/web-scraping-best-practices-2026/</link><pubDate>Wed, 01 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/blog/web-scraping-best-practices-2026/</guid><description>&lt;p&gt;Depois de construir e manter 15 scrapers de produção que atendem mais de 3,100 usuários com taxas de sucesso acima de 99%, aqui estão as práticas que realmente importam.&lt;/p&gt;
&lt;h2 id="arquitetura-pense-em-pipelines-não-em-scripts"&gt;Arquitetura: Pense em Pipelines, Não em Scripts&lt;/h2&gt;
&lt;p&gt;O maior erro que vejo é tratar o scraping como um processo de etapa única. Scrapers de produção são pipelines de dados:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Descoberta de URLs&lt;/strong&gt; — encontrar o que raspar (sitemaps, páginas de categoria, busca, APIs)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Execução de Requisições&lt;/strong&gt; — buscar os dados com retry e rotação adequados&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Parsing&lt;/strong&gt; — extrair campos estruturados a partir das respostas brutas&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Normalização&lt;/strong&gt; — limpar, validar e padronizar a saída&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Armazenamento&lt;/strong&gt; — enviar para datasets, bancos de dados ou sistemas downstream&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Cada etapa deve ser testável e reexecutável de forma independente. Quando a Sephora muda o layout da página de produto, só a etapa 3 precisa ser atualizada — o resto do pipeline permanece estável.&lt;/p&gt;</description></item><item><title>Entendendo a Proteção Anti-Bot: O Que Funciona em 2026</title><link>https://proooxy.com/pt/blog/bypassing-anti-bot-protection-guide/</link><pubDate>Sun, 15 Mar 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/blog/bypassing-anti-bot-protection-guide/</guid><description>&lt;p&gt;A proteção anti-bot é uma corrida armamentista. Como alguém que constrói scrapers de produção que superam esses sistemas todos os dias, aqui está a visão de um profissional sobre o cenário — o que as proteções realmente verificam e como são as técnicas legítimas de bypass.&lt;/p&gt;
&lt;h2 id="as-camadas-de-detecção"&gt;As Camadas de Detecção&lt;/h2&gt;
&lt;p&gt;Sistemas anti-bot modernos operam em camadas. Entender essas camadas é a chave para um bypass confiável:&lt;/p&gt;
&lt;h3 id="camada-1-reputação-de-ip"&gt;Camada 1: Reputação de IP&lt;/h3&gt;
&lt;p&gt;A verificação mais simples. Serviços anti-bot mantêm bancos de dados de faixas de IP conhecidas de datacenters, saídas de VPN e IPs previamente sinalizados.&lt;/p&gt;</description></item><item><title>Contato</title><link>https://proooxy.com/pt/contact/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/contact/</guid><description>&lt;h2 id="consiga-dados-que-não-estão-no-catálogo"&gt;Consiga dados que não estão no catálogo&lt;/h2&gt;
&lt;p&gt;Desenvolvo web scrapers sob medida e pipelines de dados para RAG — para equipes de IA, plataformas de dados e qualquer pessoa que precise da web aberta como JSON limpo e estruturado. Extração pontual ou feed continuamente atualizado, posso ajudar.&lt;/p&gt;
&lt;h3 id="o-que-eu-desenvolvo"&gt;O que eu desenvolvo&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Scrapers personalizados&lt;/strong&gt; — desenvolvidos sob medida para seus sites-alvo, com bypass de anti-bot já embutido&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Pipelines de dados para RAG&lt;/strong&gt; — extração, normalização, chunking e entrega de JSON pronto para recuperação no seu vector store ou warehouse&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Engenharia reversa de APIs privadas&lt;/strong&gt; — transformo endpoints não documentados de mobile/web em fontes estáveis e estruturadas&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Manutenção de scrapers&lt;/strong&gt; — mantenho extratores existentes funcionando quando os sites-alvo mudam&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Consultoria técnica&lt;/strong&gt; — revisão de arquitetura para sua stack de scraping e ingestão de dados&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="como-funciona"&gt;Como funciona&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Descreva os dados&lt;/strong&gt; — a fonte, os campos que você precisa e o formato de entrega&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Avaliação de viabilidade gratuita&lt;/strong&gt; — avalio a complexidade do alvo e sua proteção anti-bot sem custo&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Proposta e cronograma&lt;/strong&gt; — escopo claro, preço fixo, data de entrega&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Desenvolvimento e entrega&lt;/strong&gt; — extrator de nível de produção com documentação e saída limpa&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="inicie-um-projeto"&gt;Inicie um projeto&lt;/h3&gt;
&lt;form action="https://api.web3forms.com/submit" method="POST" class="form contact-form"&gt;
 &lt;input type="hidden" name="access_key" value="9ed3e6ad-95b9-46d5-b3f7-3ffd428d9c3a"&gt;
 &lt;div class="field"&gt;
 &lt;label for="name"&gt;nome&lt;/label&gt;
 &lt;input type="text" name="name" id="name" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="email"&gt;e-mail&lt;/label&gt;
 &lt;input type="email" name="email" id="email" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="project"&gt;tipo de projeto&lt;/label&gt;
 &lt;select name="project" id="project"&gt;
 &lt;option value="custom-scraper"&gt;Scraper personalizado&lt;/option&gt;
 &lt;option value="rag-pipeline"&gt;Pipeline de dados para RAG&lt;/option&gt;
 &lt;option value="api-reverse-engineering"&gt;Engenharia reversa de API privada&lt;/option&gt;
 &lt;option value="consulting"&gt;Consultoria técnica&lt;/option&gt;
 &lt;option value="other"&gt;Outro&lt;/option&gt;
 &lt;/select&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="message"&gt;o que você precisa?&lt;/label&gt;
 &lt;textarea name="message" id="message" rows="5" required&gt;&lt;/textarea&gt;
 &lt;/div&gt;
 &lt;button type="submit" class="btn btn--primary btn--lg"&gt;enviar mensagem&lt;/button&gt;
&lt;/form&gt;
&lt;h3 id="ou-fale-comigo-diretamente"&gt;Ou fale comigo diretamente&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;E-mail&lt;/strong&gt;: &lt;a href="mailto:p8p9cmk96@mozmail.com"&gt;p8p9cmk96@mozmail.com&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GitHub&lt;/strong&gt;: &lt;a href="https://github.com/autofacts"&gt;@autofacts&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Apify&lt;/strong&gt;: &lt;a href="https://apify.com/autofacts"&gt;apify.com/autofacts&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Sobre</title><link>https://proooxy.com/pt/about/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/pt/about/</guid><description>&lt;h2 id="quem-eu-sou"&gt;Quem eu sou&lt;/h2&gt;
&lt;p&gt;Sou Richard Feng, engenheiro freelancer de automação web com mais de 12 anos de experiência em programação. Sou especializado em &lt;strong&gt;web scraping, extração de dados e engenharia reversa de APIs&lt;/strong&gt; — transformando sites complexos e protegidos em dados limpos e estruturados que sistemas de IA realmente conseguem usar.&lt;/p&gt;
&lt;p&gt;Meu conjunto de ferramentas abrange &lt;strong&gt;Node.js (TypeScript), Python, Go e Java&lt;/strong&gt;, com profundo conhecimento em &lt;strong&gt;Crawlee, Playwright e Cheerio&lt;/strong&gt;. Já construí sistemas de produção que processam milhões de requisições com &lt;strong&gt;&amp;gt;99% de sucesso&lt;/strong&gt;.&lt;/p&gt;</description></item></channel></rss>