# Proooxy — Dados web prontos para RAG para agentes de IA e LLMs — Conteúdo Completo (llms-full.txt) > Dados web estruturados e prontos para RAG para agentes de IA, pipelines de recuperação e LLMs. Richard Feng cria atores Apify de nível de produção para e-commerce, arquivos SEC/EDGAR, gastos federais, decisões judiciais, ensaios clínicos e dados sociais e de vídeo — bypass de anti-bot, JSON limpo com esquema consistente e sem chaves de API para dados públicos. Este arquivo é uma concatenação, em documento único, de todas as páginas públicas de https://proooxy.com/pt/, destinada à ingestão direta por LLMs e agentes de IA. Cada página é precedida por um bloco de fatos com o frontmatter estruturado (URL, tipo, categoria, tecnologia, regiões, datas) e seguida pelo corpo completo em Markdown. Gerado automaticamente a partir do site em produção. --- ## Metadados do site - **Site:** Proooxy — Dados web prontos para RAG para agentes de IA e LLMs - **URL:** https://proooxy.com/pt/ - **Descrição:** Dados web estruturados e prontos para RAG para agentes de IA, pipelines de recuperação e LLMs. Richard Feng cria atores Apify de nível de produção para e-commerce, arquivos SEC/EDGAR, gastos federais, decisões judiciais, ensaios clínicos e dados sociais e de vídeo — bypass de anti-bot, JSON limpo com esquema consistente e sem chaves de API para dados públicos. - **Autor:** Richard Feng - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **Ferramentas:** 17 atores de produção - **Posts:** 2 - **Última geração:** 2026-08-04 --- ## Índice do catálogo de ferramentas - [Macy's Scraper — Produtos, Preços, SKUs e Notícias](https://proooxy.com/pt/tools/macys-scraper/) — Produtos, preços, SKUs/UPCs e notícias da Macy's — à prova de Akamai, sem navegador. - [Bluesky Scraper — Posts, Perfis, Feeds e Interações](https://proooxy.com/pt/tools/bluesky-scraper/) — Extraia posts, perfis, feeds e interações do Bluesky. - [ClinicalTrials.gov Scraper — Estudos, Elegibilidade e Resultados](https://proooxy.com/pt/tools/clinical-trials-scraper/) — Pesquise estudos, elegibilidade e resultados no ClinicalTrials.gov. - [CourtListener Scraper — Decisões, Processos e Texto Completo](https://proooxy.com/pt/tools/courtlistener-scraper/) — Jurisprudência dos EUA, processos e texto completo de decisões para IA jurídica. - [SEC EDGAR Scraper — Arquivos, Texto Completo e Dados Financeiros XBRL](https://proooxy.com/pt/tools/sec-edgar-scraper/) — Arquivos da SEC, texto de 10-K/10-Q e dados financeiros XBRL — prontos para RAG. - [USAspending.gov Scraper — Concessões Federais, Beneficiários e Agregados](https://proooxy.com/pt/tools/usaspending-scraper/) — Concessões federais, beneficiários e agregados de gastos do USAspending.gov. - [YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/pt/tools/youtube-transcript-scraper/) — Transcrições do YouTube em JSON, SRT, VTT ou texto pronto para LLM. - [Sephora Scraper (Global)](https://proooxy.com/pt/tools/sephora-scraper/) — Extraia dados de qualquer loja Sephora — 21 mercados, um único ator. - [Boohoo Scraper — Dados de Produtos em 7 Regiões](https://proooxy.com/pt/tools/boohoo-scraper/) — Extraia dados de produtos da Boohoo em 7 lojas regionais. - [Farfetch Scraper — Dados de Produtos de Moda de Luxo](https://proooxy.com/pt/tools/farfetch-scraper/) — Extraia produtos de moda de luxo da Farfetch com suporte a múltiplas moedas. - [Global API Load Tester — Teste de Carga de 10K+ RPS](https://proooxy.com/pt/tools/load-tester/) — Simule 10K+ RPS com testes de carga geodistribuídos. - [Lululemon Scraper — Produtos, Variantes e Preços](https://proooxy.com/pt/tools/lululemon-scraper/) — Extraia dados de produtos com variantes e mídia da Lululemon. - [Schema Markup Scraper e Auditor de SEO](https://proooxy.com/pt/tools/schema-markup-scraper/) — Extraia dados estruturados e audite o SEO de qualquer site. - [Sephora EU Scraper — 9 Mercados Europeus](https://proooxy.com/pt/tools/sephora-eu-scraper/) — Extraia dados de produtos da Sephora em 9 mercados europeus. - [Shopify Scraper — Dados de Produtos de Qualquer Loja](https://proooxy.com/pt/tools/shopify-scraper/) — Extraia dados de produtos de qualquer loja Shopify. - [Ulta Beauty Scraper — Produtos, Preços e SKUs](https://proooxy.com/pt/tools/ulta-scraper/) — Extraia dados completos de produtos da Ulta Beauty. - [Universal Web Printer — URL e HTML para PDF, Imagem](https://proooxy.com/pt/tools/web-printer/) — Converta URLs e HTML em PDF, PNG, JPEG ou WebP. --- # Macy's Scraper — Produtos, Preços, SKUs e Notícias - **URL:** https://proooxy.com/pt/tools/macys-scraper/ - **Tipo:** tools - **Descrição:** Extraia dados de produtos da Macy's — preços, variantes, códigos de barras SKU/UPC, imagens, avaliações e reviews — além de notícias da Macy's Inc., a partir de URLs de busca, categoria, trending e produto. Sem navegador, à prova de Akamai. - **Resumo:** Produtos, preços, SKUs/UPCs e notícias da Macy's — à prova de Akamai, sem navegador. - **Categoria:** ecommerce - **Stack técnica:** TypeScript, Crawlee, Cheerio - **Mercados / regiões:** Estados Unidos - **Página no Apify:** https://apify.com/autofacts/macy-s-scraper - **Palavras-chave:** scraper macys, dados de produtos macy's, monitoramento de preços macys, scraper de loja de departamento, dados de sku upc macys, scraper de reviews macys, dados de produtos de varejo - **Publicado:** 2026-07-15 - **Modificado:** 2026-07-15 **Principais recursos:** - Quatro superfícies em um único ator — busca de produtos, categoria, trending e notícias da Macy's Inc. - Supera o Akamai Bot Manager sem usar navegador, aproveitando as próprias APIs JSON do app mobile e do site da Macy's - Códigos de barras UPC por SKU, com cor, tamanho, disponibilidade e preço para cada variante disponível para compra - Preços como inteiros em centavos, além de strings formatadas localizadas — sem arredondamento de ponto flutuante - Inteligência completa de reviews — histograma de estrelas, contagens de recomendação e avaliações secundárias de caimento/tamanho - Todas as tonalidades e tamanhos agrupados em um único registro de produto, não uma linha por variante - Somente URLs canônicas limpas — endpoints internos de API e chaves de cliente nunca vazam para a saída - Um único esquema normalizado para resultados de busca, categoria, trending e detalhe de produto **Casos de uso:** - Monitoramento de preços e promoções de lojas de departamento em nível de SKU - Análise competitiva — Macy's vs. Nordstrom, Ulta ou precificação DTC de marcas - Correspondência de catálogo entre varejistas via códigos de barras UPC por variante - Inteligência de reviews e avaliações para marcas vendidas na Macy's - Monitoramento de notícias de varejo — press releases e anúncios de resultados da Macy's Inc. **Parâmetros de entrada:** - `scrapeType` (string, obrigatório) — Superfície a raspar: search, category, trending, news ou all (padrão: search). - `query` (string, opcional) — Palavra-chave para busca de produtos, ex.: women shoes. - `startUrls` (array, opcional) — URLs de produto/categoria da Macy's ou URLs de notícias da Macy's Inc. - `categoryIds` (array, opcional) — IDs de categoria da Macy's (ex.: 5449). URLs de categoria são preferíveis quando conhecidas. - `trendingUrls` (array, opcional) — URLs de listagens trending, mais vendidos ou curadas. - `newsUrls` (array, opcional) — URLs de listagem de notícias ou artigos da Macy's Inc. - `includeProductDetails` (boolean, opcional) — Enriquece os itens da listagem com detalhes completos do produto — variantes, SKUs, galerias (padrão: true). - `maxPages` (number, opcional) — Profundidade máxima de paginação por fonte de listagem/notícia. - `maxResults` (number, opcional) — Limite de registros de saída. 0 = sem limite. - `proxy` (object, obrigatório) — Apify Proxy ou URLs de proxy personalizadas. Residencial, país US recomendado. **FAQ:** **Q: Como ele supera o Akamai sem usar navegador?** Ele simplesmente não enfrenta o desafio de JS. As listagens vêm da API do aplicativo mobile da Macy's, e os detalhes de produto vêm da API JSON do site — ambas rodam em infraestrutura separada que responde a requisições de leitura anônimas. Sem login, sem cookies, sem chave de API. **Q: Os preços estão em dólares ou centavos?** Inteiros em centavos (5999 = $59.99) para evitar arredondamento de ponto flutuante, acompanhados de strings formatadas localizadas ($59.99). **Q: Como variantes e UPCs são tratados?** Todas as cores e tamanhos são agrupados em um único registro de produto, com um array variants[]. Cada variante carrega seu próprio código de barras UPC, cor, tamanho, disponibilidade e preço — recuperados dos dados de relacionamento de SKU da Macy's, não extraídos de um widget de amostras visual. **Q: Posso raspar produtos e notícias em uma única execução?** Sim. Defina scrapeType como all e forneça qualquer combinação de query, startUrls, categoryIds, trendingUrls e newsUrls. ## Exemplo de Saída ```json { "type": "product", "source": { "id": "12345678", "canonicalUrl": "https://www.macys.com/shop/product/calvin-klein-womens-sheath-dress?ID=12345678", "retailer": "macys", "currency": "USD" }, "title": "Women's Sleeveless Sheath Dress", "brand": "Calvin Klein", "categories": ["Women", "Dresses", "Work Dresses"], "price": { "sale": 5999, "list": 9800, "currentFormatted": "$59.99", "stockStatus": "InStock" }, "stats": { "rating": 4.6, "reviewCount": 9, "ratingPercentage": 92 }, "options": [ { "type": "Color", "values": [{ "id": "1", "name": "Black" }] }, { "type": "Size", "values": [{ "id": "10", "name": "M" }, { "id": "12", "name": "L" }] } ], "variants": [ { "id": "987654", "sku": "192837465012", "options": ["Black", "M"], "price": { "stockStatus": "InStock" }, "extraInfo": { "upc": "192837465012" } } ], "medias": [{ "type": "Image", "url": "https://slimages.macysassets.com/is/image/MCY/products/.../main.jpg" }] } ``` ## Preços Pagamento por evento — você paga apenas pelos itens realmente salvos: | Evento | Preço | O que cobre | |---|---|---| | Produto raspado | $0.006 | Um produto com detalhe completo — variantes, SKUs/UPCs, preços, imagens, avaliações | | Artigo raspado | $0.002 | Um artigo de notícia da Macy's Inc. — título, autor, data, corpo, imagens | Descontos por volume se aplicam automaticamente em planos Apify superiores (até $0.0045 por produto). Um rastreamento de 1,000 produtos é ~$6.00 no preço de tabela. ## Dicas - **Use proxies residenciais dos EUA.** O endpoint de detalhe de produto tem rate limit intermitente; a rotação de sessão residencial passa limpo, enquanto IPs de datacenter recebem mais 403s. - **Mantenha a concorrência moderada.** `maxConcurrency` de 2–3 é o ponto ideal — valores mais altos aumentam os bloqueios de rate limit sem melhorar o throughput. - **Prefira URLs de categoria em vez de IDs isolados.** A URL carrega o caminho de categoria que a API espera; um ID isolado pode resolver para um conjunto de resultados mais amplo ou vazio. - **Desative `includeProductDetails`** para uma varredura rápida em nível de listagem (nome, marca, preço de listagem, imagem, avaliação) quando você não precisar de variantes ou descrições. --- # Bluesky Scraper — Posts, Perfis, Feeds e Interações - **URL:** https://proooxy.com/pt/tools/bluesky-scraper/ - **Tipo:** tools - **Descrição:** Extraia posts, perfis, seguidores, feeds, threads e listas de curtidas e republicações do Bluesky via AT Protocol — além de busca autenticada e resultados de hashtags com uma app password. JSON limpo e normalizado. - **Resumo:** Extraia posts, perfis, feeds e interações do Bluesky. - **Categoria:** social - **Stack técnica:** TypeScript, AT Protocol - **Mercados / regiões:** Global - **Página no Apify:** https://apify.com/autofacts/bluesky-scraper - **Palavras-chave:** scraper bluesky, api do bluesky, dados do at protocol, extrair posts do bluesky, dados de perfil bluesky, scraper de hashtag bluesky, extração de dados de redes sociais - **Publicado:** 2026-07-01 - **Modificado:** 2026-07-01 **Principais recursos:** - Onze modos — search, profile, posts, followers, following, feed, thread, likers, reposters, actorLikes e hashtag - API pública sem necessidade de credenciais para perfis, posts, seguidores, contas seguidas, feeds, threads, curtidas e republicações - Modos autenticados com app password — busca, hashtag e curtidas da própria conta - Exportação de engajamento por post — listas completas de quem curtiu e quem republicou cada post - Achatamento de threads — percorre uma árvore de respostas até uma profundidade configurável - Paginação automática por cursor em todos os endpoints de lista, até o seu limite de itens - Formato JSON normalizado para posts e perfis em todos os modos - HTTP resiliente — throttling de requisições, backoff exponencial e retry em 429/5xx **Casos de uso:** - Monitoramento de marca e palavras-chave via busca autenticada - Rastreamento de hashtags e tendências na rede - Exportação de audiência — listas de seguidores e contas seguidas de um criador ou marca - Análise de engajamento — exatamente quem curtiu ou republicou um determinado post - Construção de datasets para BI, analytics ou pipelines de RAG a partir de JSON limpo e normalizado - Arquivamento de conversas e threads a partir de um post **Parâmetros de entrada:** - `mode` (string, opcional) — O que raspar: posts, profile, followers, following, feed, thread, likers, reposters, actorLikes, search ou hashtag (padrão: posts). - `handles` (array, opcional) — Handles do Bluesky para os modos profile/posts/followers/following/actorLikes, ex.: bsky.app. - `query` (string, opcional) — Texto de busca (modo search) ou hashtag (modo hashtag — com # adicionado automaticamente). - `postUri` (string, opcional) — URI AT de um post — usado pelos modos thread, likers e reposters. - `feedUri` (string, opcional) — URI AT de um feed personalizado — usado pelo modo feed. - `identifier` (string, opcional) — Handle/e-mail de login do Bluesky para modos autenticados (search, hashtag, actorLikes). - `appPassword` (string, opcional) — App password do Bluesky (não a sua senha principal) para os modos autenticados. - `maxItems` (number, opcional) — Máximo de posts/perfis salvos; cada um é um evento cobrado (padrão: 100). **FAQ:** **Q: Preciso de credenciais do Bluesky?** Só para os modos search, hashtag e actorLikes — gere uma app password nas configurações do Bluesky e informe-a em appPassword. Os modos profile, posts, followers, following, feed, thread, likers e reposters funcionam sem credenciais, via API pública do AT Protocol. **Q: Posso exportar as curtidas de qualquer conta?** Não. A API do Bluesky só expõe actorLikes para a própria conta autenticada, então o handle e o identificador de login precisam se referir à mesma conta. **Q: Como encontro a URI de um post ou feed?** URIs AT têm o formato at://did:plc:.../app.bsky.feed.post/... — copie-as da saída da API do Bluesky ou de ferramentas de desenvolvedor. URIs de feed usam a coleção app.bsky.feed.generator. **Q: É seguro usar minha app password?** Sim — use uma app password do Bluesky (criada em Settings → App Passwords), nunca a sua senha principal. Ela é restrita em escopo, revogável e enviada como um input secreto. ## Exemplo de Saída ```json { "itemType": "post", "mode": "posts", "uri": "at://did:plc:.../app.bsky.feed.post/...", "author": { "did": "did:plc:...", "handle": "bsky.app", "displayName": "Bluesky", "followersCount": 1234567 }, "text": "Example post text", "createdAt": "2026-06-11T00:00:00Z", "replyCount": 10, "repostCount": 20, "likeCount": 100, "langs": ["en"], "url": "https://bsky.app/profile/bsky.app/post/..." } ``` ## Preços Pagamento por evento: **$0.001 por item** (post ou perfil) salvo. Uma exportação de 1,000 itens é ~$1.00, e `maxItems` limita tanto o volume quanto o custo. ## Dicas - **Comece pelos modos públicos.** Perfis, posts, seguidores e engajamento (likers/reposters) não exigem login — reserve a autenticação por app password para execuções de search e hashtag. - **Exporte engajamento, não só posts.** Os modos likers e reposters revelam exatamente quem amplificou um post — um sinal que a maioria dos scrapers de Bluesky ignora. - **Limite `maxItems`** em extrações de seguidores/contas seguidas de contas grandes para manter as execuções rápidas e os custos previsíveis. --- # ClinicalTrials.gov Scraper — Estudos, Elegibilidade e Resultados - **URL:** https://proooxy.com/pt/tools/clinical-trials-scraper/ - **Tipo:** tools - **Descrição:** Pesquise na API v2 oficial do ClinicalTrials.gov por condição, intervenção, patrocinador, localização, status ou ID NCT. Exporte registros de estudos normalizados com elegibilidade, metadados de resultados e atualizações incrementais — sem chave de API. - **Resumo:** Pesquise estudos, elegibilidade e resultados no ClinicalTrials.gov. - **Categoria:** public-data - **Stack técnica:** TypeScript, REST API - **Mercados / regiões:** Global - **Página no Apify:** https://apify.com/autofacts/clinical-trials-scraper - **Palavras-chave:** api do clinicaltrials.gov, dados de ensaios clínicos, dataset de ensaios clínicos, dados de estudos em recrutamento, dados de elegibilidade de ensaios clínicos, monitoramento de pipeline farmacêutico, ensaios clínicos para rag - **Publicado:** 2026-07-01 - **Modificado:** 2026-07-01 **Principais recursos:** - API v2 oficial do ClinicalTrials.gov — sem necessidade de chave de API - Busca multi-campo — condição, intervenção, patrocinador, localização e consulta em texto livre - Filtro por status de recrutamento (9 valores, combinados com OR) e fase (Early Phase 1 → Phase 4) - Busca direta por ID NCT para um ou vários estudos específicos - Monitoramento incremental via updatedSince — retorna apenas estudos alterados a partir de uma data - Saída summary ou full — o modo full adiciona as seções brutas de protocolo, derivadas e de resultados - Chunking em parágrafos pronto para RAG a partir de títulos, resumos, elegibilidade e desfechos - Sinais de resultados — hasResults, além de flags de fluxo de participantes, medidas de desfecho e eventos adversos - Termos MeSH derivados e dados normalizados de patrocinador, colaborador e localização **Casos de uso:** - Monitoramento de pipeline farmacêutico/biotech por patrocinador ou condição - Pesquisa de viabilidade para CROs e centros de pesquisa — estudos em recrutamento por localização, fase e condição - Inteligência competitiva sobre estudos recém-publicados ou recém-atualizados - Pesquisa de recrutamento de pacientes em estudos ativamente em recrutamento - Revisões sistemáticas — critérios de elegibilidade, desfechos e metadados de resultados em escala - Bases de conhecimento de IA médica / RAG construídas a partir de texto de ensaios em chunks **Parâmetros de entrada:** - `condition` (string, opcional) — Condição ou doença a pesquisar, ex.: diabetes. - `status` (array, opcional) — Filtro de status de recrutamento, combinado com OR, ex.: RECRUITING, COMPLETED. - `phase` (array, opcional) — Fases do estudo — Not Applicable, Early Phase 1, Phase 1–4. - `nctIds` (array, opcional) — Busca estudos específicos pelo ID NCT do ClinicalTrials.gov. - `updatedSince` (string, opcional) — AAAA-MM-DD — retorna estudos com LastUpdatePostDate igual ou posterior a essa data. - `outputFields` (string, opcional) — summary (padrão, normalizado) ou full (adiciona as seções brutas de protocolo/derivadas/resultados). - `chunking` (string, opcional) — Chunking de texto para RAG: paragraph (padrão) ou none. - `maxItems` (number, opcional) — Máximo de estudos salvos; cada um é um evento cobrado (padrão: 10). **FAQ:** **Q: Preciso de uma chave de API?** Não. A API v2 do ClinicalTrials.gov é totalmente pública — o ator envia apenas um User-Agent descritivo, sem autenticação. **Q: Posso obter os dados brutos do estudo, não só os campos normalizados?** Sim. Defina outputFields como 'full' para incluir as seções brutas protocolSection, derivedSection e resultsSection junto com os campos normalizados do modo summary. **Q: Como monitoro estudos que mudaram recentemente?** Defina updatedSince com uma data no formato AAAA-MM-DD. O ator filtra pelo LastUpdatePostDate do ClinicalTrials.gov e retorna apenas estudos atualizados naquele dia ou depois — ideal para monitoramento diário de pipeline. **Q: A cobertura é global ou só dos EUA?** Global. O ClinicalTrials.gov registra estudos no mundo todo, e o array locations de cada estudo inclui país, estado, cidade e instituição quando informados. ## Exemplo de Saída ```json { "itemType": "study", "nctId": "NCT01884792", "title": "Example Diabetes Study", "officialTitle": "A Study of Example Diabetes Study", "status": "COMPLETED", "phase": ["PHASE2"], "studyType": "INTERVENTIONAL", "conditions": ["Diabetes Mellitus"], "sponsors": { "lead": "Example Sponsor Inc.", "collaborators": [] }, "locations": [ { "facility": "Example Medical Center", "city": "Boston", "state": "MA", "country": "United States", "status": "COMPLETED" } ], "hasResults": true, "resultsSummary": { "hasParticipantFlow": true, "hasOutcomeMeasures": true, "hasAdverseEvents": true }, "lastUpdate": "2026-06-01", "url": "https://clinicaltrials.gov/study/NCT01884792" } ``` ## Preços Pagamento por evento: **$0.002 por estudo** salvo, independentemente do modo de saída summary ou full. Uma exportação de 1,000 estudos é ~$2.00, e `maxItems` limita tanto o volume quanto o custo. ## Dicas - **Use `updatedSince` para monitoramento de mudanças.** Agende uma execução diária com a data de ontem para capturar apenas estudos publicados ou alterados — a forma mais barata de acompanhar o pipeline de um concorrente. - **Combine `condition` + `status: [RECRUITING]` + `phase`** para construir uma lista de viabilidade direcionada sem baixar o registro completo. - **Defina `outputFields: full`** somente quando precisar das seções brutas — o modo summary normalizado já inclui elegibilidade, patrocinadores, localizações e flags de resultados. --- # CourtListener Scraper — Decisões, Processos e Texto Completo - **URL:** https://proooxy.com/pt/tools/courtlistener-scraper/ - **Tipo:** tools - **Descrição:** Consulte o CourtListener em busca de decisões judiciais dos EUA, processos RECAP, sustentações orais, juízes e citações — com texto completo das decisões e chunks prontos para RAG. Filtre por tribunal, data ou palavra-chave. - **Resumo:** Jurisprudência dos EUA, processos e texto completo de decisões para IA jurídica. - **Categoria:** public-data - **Stack técnica:** TypeScript, Cheerio - **Mercados / regiões:** Estados Unidos - **Página no Apify:** https://apify.com/autofacts/courtlistener-scraper - **Palavras-chave:** api do courtlistener, api de dados de jurisprudência, scraper de decisões judiciais, dados de processos recap, dados de pesquisa jurídica, dataset de jurisprudência dos eua, jurisprudência para rag - **Publicado:** 2026-07-01 - **Modificado:** 2026-07-01 **Principais recursos:** - Seis tipos de busca em um único ator — decisões, processos (RECAP), documentos RECAP, sustentações orais, juízes e busca por citação - Texto completo das decisões — segue os resultados da busca até o banco de dados para obter decisões completas, não apenas trechos de 300 caracteres - Chunking pronto para RAG — chunks de parágrafos de ~2000 caracteres, cada um com um índice de ordem - Resolução de citações — resolve até 250 strings de citação (ex.: 576 U.S. 644) para os casos correspondentes - Busca booleana em texto completo, além de filtros por ID do tribunal, intervalo de data de protocolo e ordenação - Pacing consciente de rate limit, com backoff preciso em respostas 429, em todos os formatos de resposta do CourtListener - Streaming com paginação por cursor até o limite de itens configurado - Use seu próprio token ou o pool rotativo de tokens integrado **Casos de uso:** - Pesquisa jurídica — obtenha jurisprudência em texto completo por tribunal, intervalo de data ou palavra-chave - Inteligência de litígios — acompanhe a atividade processual de um tribunal por assunto e data - IA jurídica / RAG — construa um corpus de jurisprudência em chunks, pronto para embeddings - Análise de citações — resolva as citações de uma petição para registros de casos vinculados e contagens de citação - Estudos jurídicos empíricos — juízes, metadados de sustentações orais e tendências de decisões - Jornalismo jurídico — monitore decisões ou processos recém-protocolados em tribunais específicos **Parâmetros de entrada:** - `searchType` (string, opcional) — O que buscar: opinions, dockets, recap_docs, oral_arguments, judges ou citation (padrão: opinions). - `query` (string, opcional) — Consulta em texto completo com operadores booleanos — obrigatória, a menos que use um filtro de tribunal ou busca por citação. - `citations` (array, opcional) — Strings de citação a resolver (até 250) — obrigatório no modo citation. - `court` (string, opcional) — ID do tribunal no CourtListener, ex.: scotus, ca9, nyed. - `dateFrom` (string, opcional) — Data a partir da qual o processo foi protocolado (AAAA-MM-DD). - `includeFullText` (boolean, opcional) — Busca o texto completo da decisão e chunks para RAG no modo opinions (padrão: false). - `apiToken` (string, opcional) — Seu token de API do CourtListener; se omitido, usa o pool rotativo integrado. - `maxItems` (number, opcional) — Máximo de itens salvos; cada um é um evento cobrado (padrão: 5). **FAQ:** **Q: Preciso de um token de API do CourtListener?** O CourtListener exige um. Forneça seu próprio token gratuito via apiToken, ou conte com o pool rotativo de fallback integrado ao ator. Usar seu próprio token permite aumentar o throughput em um plano pago/de membro. **Q: O texto completo das decisões está disponível para todos os tipos de busca?** Não. O texto completo e o chunking (includeFullText) se aplicam somente ao modo opinions, e vêm desativados por padrão para manter as execuções rápidas. Dockets, documentos RECAP, sustentações orais, juízes e resultados de citação retornam apenas metadados. **Q: Quais tribunais são cobertos?** Tudo o que o CourtListener indexa — tribunais federais dos EUA (SCOTUS, Courts of Appeals e District Courts via RECAP), além de diversos tribunais estaduais, identificados pelos próprios IDs de tribunal do CourtListener, como scotus, ca9 ou nyed. **Q: Qual a velocidade máxima de execução?** O throughput é limitado pelo rate limit do seu token (o plano gratuito do CourtListener permite poucas requisições por minuto), com backoff automático em 429; um token de membro eleva esse limite. ## Exemplo de Saída ```json { "itemType": "legal", "searchType": "opinions", "id": "10380001", "title": "Climate United Fund v. Citibank, N.A.", "court": "Court of Appeals for the D.C. Circuit", "date": "2025-04-16", "url": "https://www.courtlistener.com/opinion/10380001/...", "citations": [], "citeCount": 0, "docketNumber": "23-5138", "fullText": "...", "chunks": [{ "text": "...", "order": 0 }], "meta": { "courtId": "cadc", "clusterId": 10380001 } } ``` ## Preços Pagamento por evento — você paga apenas pelos itens salvos: | Evento | Preço | O que cobre | |---|---|---| | Decisão com texto completo | $0.005 | Uma decisão salva com texto completo + chunks para RAG | | Item de metadados | $0.002 | Um processo, sustentação oral, juiz, citação ou registro somente de metadados | Um corpus de texto completo com 1,000 decisões é ~$5.00; `maxItems` limita tanto o volume quanto o custo. ## Dicas - **Ative `includeFullText` somente para decisões que você realmente vai usar em embeddings.** Isso custa requisições extras por decisão e vem desativado por padrão — filtre bem por tribunal e data antes. - **Use o modo `citation` para enriquecer uma petição.** Cole as strings de citação e receba de volta registros de casos vinculados e contagens de citação em uma única execução. - **Use seu próprio token do CourtListener** para jobs maiores — o rate limit baixo do plano gratuito é o principal gargalo de throughput. --- # SEC EDGAR Scraper — Arquivos, Texto Completo e Dados Financeiros XBRL - **URL:** https://proooxy.com/pt/tools/sec-edgar-scraper/ - **Tipo:** tools - **Descrição:** Extraia metadados de arquivos do SEC EDGAR, seções em texto completo de 10-K/10-Q, resultados de busca em texto completo do EDGAR e fatos financeiros XBRL como JSON limpo e pronto para RAG. Sem necessidade de chave de API. - **Resumo:** Arquivos da SEC, texto de 10-K/10-Q e dados financeiros XBRL — prontos para RAG. - **Categoria:** public-data - **Stack técnica:** TypeScript, Cheerio - **Mercados / regiões:** Estados Unidos - **Página no Apify:** https://apify.com/autofacts/sec-edgar-scraper - **Palavras-chave:** api sec edgar, scraper sec edgar, dados de arquivos 10-k, scraper de 10-q, dados financeiros xbrl, busca em texto completo edgar, arquivos sec para rag, api de dados financeiros de empresas - **Publicado:** 2026-07-01 - **Modificado:** 2026-07-01 **Principais recursos:** - Quatro modos em um único ator — metadados de arquivos, texto completo de documentos, busca em texto completo do EDGAR e fatos financeiros XBRL - Chunking pronto para RAG — section, paragraph (~2000 caracteres) ou none; cada chunk marcado com seu Item de origem e ordem - Parsing automático de seções 'Item N' para 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A e mais) - Fatos XBRL com taxonomia, tag, label, unidade, valor, ano fiscal/período, formulário e número de accession - A deduplicação de fatos condensa reformulações XBRL em uma linha por período, mantendo a divulgação mais antiga - Resolução de empresa por ticker, CIK ou nome contra o arquivo oficial de tickers da SEC, com fallback fuzzy - Busca em texto completo do EDGAR com frases entre aspas, filtros de tipo de formulário e intervalo de data (2001 → presente) - Rate limiting e User-Agent compatíveis com as normas da SEC — sem chave de API e sem necessidade de login **Casos de uso:** - Pipelines de RAG/LLM financeiros que precisam de texto de 10-K e 10-Q em chunks por seção, pronto para embeddings - Pesquisa de investimento — obtenha séries temporais de receita, lucro líquido e EPS diluído como linhas XBRL limpas - Monitoramento de compliance e propriedade — Form 4, SC 13D/13G e linguagem de fatores de risco entre empresas - Produtos fintech que precisam de dados estruturados do EDGAR sem construir um crawler personalizado - Pesquisa de mercado e setor via busca em texto completo — quem divulga uma frase, e desde quando - Fluxos de trabalho de BI e planilhas consumindo linhas de fatos financeiros XBRL limpas **Parâmetros de entrada:** - `mode` (string, obrigatório) — Modo de extração: filings, fulltext, search ou facts (padrão: filings). - `ticker` (string, opcional) — Ticker da ação, ex.: AAPL. Um entre ticker/cik/companyName é obrigatório em tempo de execução. - `cik` (string, opcional) — Central Index Key da SEC, ex.: 320193 — tem precedência sobre ticker e companyName. - `companyName` (string, opcional) — Nome do registrante na SEC, com correspondência exata ou fuzzy contra o arquivo oficial de tickers. - `query` (string, opcional) — Expressão de busca em texto completo do EDGAR, ex.: "supply chain disruption" — obrigatória no modo search. - `formTypes` (array, opcional) — Tipos de formulário a incluir, ex.: 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Vazio = todos os formulários. - `chunking` (string, opcional) — Estratégia de RAG para fulltext: section, paragraph (~2000 caracteres) ou none (padrão: section). - `maxItems` (number, opcional) — Máximo de itens salvos; cada item salvo é um evento cobrado (padrão: 100). **FAQ:** **Q: Preciso de uma chave de API da SEC?** Não. O SEC EDGAR é um dado público e gratuito. O ator se identifica com um User-Agent compatível e se autolimita automaticamente dentro do rate limit da SEC — sem chave e sem login. **Q: Até quando os dados retroagem?** A busca em texto completo do EDGAR (EFTS) cobre arquivos a partir de 2001-05-04 e tem um limite de 10,000 resultados por consulta. Os metadados de arquivos retroagem até 1994, e os fatos financeiros XBRL cobrem tudo o que a empresa reportou em XBRL. **Q: A saída está pronta para LLMs e RAG?** Sim. No modo fulltext, o ator faz o parsing de 10-K/10-Q em seções 'Item N' e gera chunks prontos para embeddings (section ou paragraph de ~2000 caracteres), cada um marcado com seu Item de origem e índice de ordem. **Q: Por que alguns arquivos são ignorados no modo fulltext?** Arquivos cujo documento principal não é HTML ou TXT (por exemplo, um XML de Form 4 somente XBRL) não podem ter as seções parseadas, então são ignorados — e não são cobrados. ## Exemplo de Saída ```json { "itemType": "filing-fulltext", "title": "Apple Inc. — 10-K 2025-10-31", "company": "Apple Inc.", "ticker": "AAPL", "cik": "0000320193", "formType": "10-K", "filedAt": "2025-10-31", "accessionNo": "0000320193-25-000123", "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...", "sections": [ { "name": "Item 1A — Risk Factors", "charCount": 38241 }, { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 } ], "chunks": [ { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 } ], "textLength": 220151 } ``` ## Preços Pagamento por evento — você paga apenas pelos itens realmente salvos: | Evento | Preço | O que cobre | |---|---|---| | Metadados de arquivo / resultado de busca | $0.001 | Um registro de metadados de arquivo ou resultado de busca em texto completo | | Arquivo em texto completo | $0.005 | Um arquivo extraído, com seções parseadas e dividido em chunks para RAG | | Fato XBRL | $0.0002 | Uma linha de fato financeiro XBRL | Uma extração de metadados de 1,000 arquivos é ~$1.00; 1,000 fatos XBRL é ~$0.20. `maxItems` limita tanto o volume quanto o custo. ## Dicas - **Comece pelo modo `facts` para dados financeiros.** Extrair linhas XBRL (receita, lucro líquido, EPS) é muito mais barato e limpo do que fazer parsing de arquivos completos quando você só precisa dos números. - **Use `chunking: section` para RAG.** Isso mantém cada Item (Risk Factors, MD&A) intacto, para que a recuperação retorne passagens coerentes e citáveis. - **A busca em texto completo cobre a partir de 2001.** Para divulgações mais antigas, resolva a empresa pelo CIK e extraia os metadados de arquivos diretamente. --- # USAspending.gov Scraper — Concessões Federais, Beneficiários e Agregados - **URL:** https://proooxy.com/pt/tools/usaspending-scraper/ - **Tipo:** tools - **Descrição:** Consulte a API v2 oficial do USAspending.gov para contratos, subvenções e empréstimos federais. Filtre por agência, beneficiário, NAICS/PSC ou data, e obtenha perfis de beneficiários, totais por categoria e agregados geográficos por estado/condado/distrito. Sem chave de API. - **Resumo:** Concessões federais, beneficiários e agregados de gastos do USAspending.gov. - **Categoria:** public-data - **Stack técnica:** TypeScript, REST API - **Mercados / regiões:** Estados Unidos - **Página no Apify:** https://apify.com/autofacts/usaspending-scraper - **Palavras-chave:** api usaspending, dados de contratos federais, dados de gastos governamentais, dados de subvenções federais, pesquisa de mercado govcon, dados de concessões federais, dados de contratos naics psc - **Publicado:** 2026-07-01 - **Modificado:** 2026-07-01 **Principais recursos:** - API v2 oficial do USAspending.gov — sem necessidade de chave de API - Busca de concessões por palavras-chave, ano fiscal/intervalo de data, agência, beneficiário, NAICS, PSC, valor e tipo de concessão - Seis modos — busca de concessões, detalhe de concessão, subconcessões, perfil de beneficiário, totais por categoria e geografia - 18 dimensões de agregação por categoria (beneficiário, NAICS, PSC, agência, condado, distrito, CFDA, TAS e mais) - Agregados geográficos por estado, condado, distrito congressional e país, com campos de população e per capita - Fatiamento automático de data (mensal/trimestral) para grandes conjuntos de resultados multi-anuais - Agrupamento automático de códigos de tipo de concessão em grupos de requisição válidos para a API - Busca exata de detalhe de concessão e subconcessão pelo ID de concessão gerado **Casos de uso:** - Desenvolvimento de negócios GovCon — encontre oportunidades e contratados incumbentes por NAICS, PSC ou agência - Inteligência competitiva sobre o histórico de concessões e relacionamentos com agências de um concorrente - Jornalismo investigativo rastreando gastos federais até beneficiários ou geografias específicas - Pesquisa de políticas públicas e acadêmica sobre tendências de gastos por categoria, tipo de concessão ou período - Revisão de due diligence do histórico de concessões e gastos federais de um beneficiário - Dashboards de BI mapeando gastos federais por estado, condado ou distrito congressional **Parâmetros de entrada:** - `mode` (string, opcional) — Fluxo: awards, awardDetail, subawards, recipient, byCategory ou geography (padrão: awards). - `keywords` (array, opcional) — Filtros de palavra-chave em texto livre do USAspending para busca de concessões. - `fiscalYear` (number, opcional) — Ano fiscal federal (corresponde ao intervalo de 1º de outubro a 30 de setembro). - `awardTypes` (array, opcional) — Códigos de tipo de concessão do USAspending; grupos mistos são divididos automaticamente em requisições válidas. - `agency` (string, opcional) — Filtro por nome exato da agência concedente ou financiadora. - `naicsCodes` (array, opcional) — Códigos NAICS que uma concessão deve corresponder. - `awardId` (string, opcional) — ID de concessão gerado — obrigatório em tempo de execução para os modos awardDetail e subawards. - `maxItems` (number, opcional) — Máximo de registros salvos; cada linha é um evento cobrado (padrão: 100). **FAQ:** **Q: Preciso de uma chave de API?** Não. A API v2 do USAspending.gov é pública e não exige chave nem login. **Q: Por que códigos mistos de tipo de concessão são divididos em múltiplas requisições?** O USAspending rejeita uma única busca que misture códigos de diferentes grupos de tipo de concessão (contratos, IDVs, subvenções, empréstimos, outras assistências financeiras, pagamentos diretos). O ator agrupa os códigos solicitados automaticamente e marca cada linha de saída com os códigos de tipo de concessão correspondentes. **Q: Quais desagregações geográficas estão disponíveis?** Estado, condado, distrito congressional e país — delimitados pelo local de execução ou pela localização do beneficiário, com campos de população e per capita incluídos. **Q: Como uma execução é precificada?** Pagamento por evento, a $0.001 por linha salva, cobrado uma vez por registro retornado com sucesso. maxItems limita o número de linhas e, portanto, o custo. ## Exemplo de Saída ```json { "itemType": "award", "title": "HT940216C0001 — HUMANA GOVERNMENT BUSINESS INC", "date": "2016-02-01", "awardId": "HT940216C0001", "generatedId": "CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-", "recipient": { "name": "HUMANA GOVERNMENT BUSINESS INC", "uei": "...", "duns": "..." }, "awardingAgency": "Department of Defense", "fundingAgency": "Department of Defense", "amount": 51269205263.03, "awardType": "IDV_B_C", "naics": { "code": "...", "description": "..." }, "placeOfPerformance": { "stateCode": "...", "state": "..." }, "awardTypeCodes": ["IDV_B_C"], "url": "https://www.usaspending.gov/award/CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-" } ``` ## Preços Pagamento por evento: **$0.001 por registro salvo**, cobrado uma vez por linha retornada com sucesso. Uma execução de ~1,000 registros é ~$1.00, e `maxItems` limita tanto o volume quanto o custo. ## Dicas - **Comece pelos códigos NAICS ou PSC** para prospecção GovCon — eles mapeiam diretamente para os produtos/serviços que você vende e retornam o conjunto mais limpo de concessões relevantes. - **Use o modo `byCategory`** para classificar os principais beneficiários ou agências de um mercado antes de buscar o detalhe de concessões individuais. - **O modo geography retorna a primeira página (até 100 linhas)** por combinação de intervalo de data/tipo de concessão — refine os filtros em vez de aumentar `maxItems` para totalizações por estado/condado/distrito. --- # YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM - **URL:** https://proooxy.com/pt/tools/youtube-transcript-scraper/ - **Tipo:** tools - **Descrição:** Extraia legendas e transcrições do YouTube de vídeos, Shorts, playlists e canais como JSON, SRT, VTT, texto simples ou texto limpo pronto para LLM. Mais de 100 idiomas, metadados ricos, sem chave de API — e extrações que falham são gratuitas. - **Resumo:** Transcrições do YouTube em JSON, SRT, VTT ou texto pronto para LLM. - **Categoria:** social - **Stack técnica:** TypeScript, InnerTube - **Mercados / regiões:** Global - **Página no Apify:** https://apify.com/autofacts/youtube-subtitle-transcript-scraper - **Palavras-chave:** scraper de transcrição do youtube, api de transcrição do youtube, baixar legendas youtube, converter legendas youtube em texto, transcrições do youtube em lote, transcrição youtube srt vtt, transcrições do youtube para llm - **Publicado:** 2026-07-01 - **Modificado:** 2026-07-01 **Principais recursos:** - Um único input lida com vídeos, Shorts, links youtu.be, playlists e canais — misturados em uma única execução - Cinco formatos de saída — JSON (com timestamps), SRT, VTT, texto simples e pronto para LLM (remove marcações como [Music], [Applause] e rótulos de interlocutor) - Mais de 100 idiomas, com uma lista de idiomas em ordem de prioridade e fallback de legendas automáticas ativável - Metadados ricos — título, canal, descrição, data de publicação, contagem de visualizações, thumbnail, duração e idiomas disponíveis - Processa playlists e canais inteiros em lote, com um limite maxVideos e concorrência de 1 a 10 - Suporte a proxy residencial, além de cookies opcionais para reduzir bloqueios de verificação anti-bot - Extração em múltiplas camadas — até nove fallbacks entre clientes InnerTube, com um último recurso via PO-token do yt-dlp - Circuit breaker e tratamento de erro por item mantêm lotes grandes em execução **Casos de uso:** - Times de IA/ML construindo datasets de RAG ou fine-tuning a partir de vídeo falado (saída de texto pronta para LLM) - Times de conteúdo reaproveitando transcrições em posts de blog, show notes e legendas para redes sociais - Profissionais de SEO extraindo texto de vídeo pesquisável para indexação e pesquisa de palavras-chave - Editores e publishers que precisam de arquivos de legenda padrão SRT/VTT - Pesquisadores coletando transcrições em lote de um canal ou playlist inteiro - Desenvolvedores que precisam de legendas estruturadas e com timestamp sem uma chave de API do YouTube **Parâmetros de entrada:** - `urls` (array, opcional) — URLs do YouTube ou IDs isolados — vídeos, Shorts, links youtu.be, playlists ou canais. Obrigatório em tempo de execução. - `outputFormat` (string, opcional) — Formato da transcrição: json, srt, vtt, text ou llm (padrão: json). - `languages` (array, opcional) — Idiomas de legenda preferidos em ordem de prioridade, códigos ISO 639-1 (padrão: en). - `includeAutoGenerated` (boolean, opcional) — Recorre a legendas geradas automaticamente quando as manuais não estão disponíveis (padrão: true). - `maxVideos` (number, opcional) — Limite de vídeos processados por execução, ex.: para playlists/canais (padrão: 0 = ilimitado). - `maxConcurrency` (number, opcional) — Vídeos processados em paralelo, 1–10 (padrão: 3). - `proxyConfiguration` (object, opcional) — Configurações de proxy; usa Apify Residential fixado nos EUA por padrão. - `youtubeCookies` (string, opcional) — Cookies opcionais do YouTube (header Cookie ou cookies.txt) para reduzir bloqueios de verificação anti-bot. **FAQ:** **Q: Preciso de uma chave de API do YouTube ou fazer login?** Não. O ator extrai as legendas diretamente — sem chave da YouTube Data API e sem login. Um input opcional de cookies pode ser fornecido para reduzir bloqueios do tipo 'Sign in to confirm you're not a bot' em alguns vídeos. **Q: Quais idiomas e tipos de legenda são suportados?** Mais de 100 idiomas. Forneça uma lista em ordem de prioridade de códigos ISO 639-1 (padrão: en); o ator prefere legendas criadas manualmente e recorre às geradas automaticamente, a menos que você desative includeAutoGenerated. **Q: Sou cobrado por vídeos que falham na extração?** Não. A cobrança é por evento, sobre um único evento de transcrição extraída, cobrado somente após uma transcrição ser salva com sucesso. Vídeos que falham aparecem na saída com um campo error e não são cobrados. **Q: Posso obter texto limpo, pronto para LLM, para RAG?** Sim. Defina outputFormat como 'llm' para remover anotações como [Music]/[Applause] e rótulos de interlocutor, produzindo um texto limpo ideal para embeddings e fine-tuning. ## Exemplo de Saída ```json { "videoId": "dQw4w9WgXcQ", "url": "https://www.youtube.com/watch?v=dQw4w9WgXcQ", "title": "Rick Astley - Never Gonna Give You Up (Official Video)", "channelName": "Rick Astley", "channelId": "UCuAXFkgsw1L7xaCfnd5JJOw", "publishDate": "2009-10-25", "viewCount": 1761003712, "availableLanguages": ["en", "de-DE", "ja", "pt-BR", "es-419"], "language": "en", "isAutoGenerated": false, "duration": 213, "wordCount": 487, "segmentCount": 61, "text": "We're no strangers to love, you know the rules and so do I...", "segments": [{ "text": "We're no strangers to love", "start": 18.64, "end": 21.88 }], "error": null } ``` ## Preços Pagamento por evento: cobrado uma vez por **transcrição extraída com sucesso** — vídeos que falham nunca são cobrados. Alimente um canal ou playlist inteiro e pague somente pelas legendas que você realmente recebe. ## Dicas - **Use `outputFormat: llm`** para RAG e fine-tuning — isso remove anotações que não são fala, para que seus embeddings vejam um texto limpo. - **Mantenha um proxy residencial ativo.** O YouTube bloqueia agressivamente IPs de datacenter; o ator usa residencial dos EUA por padrão, por um motivo. - **Comece `maxConcurrency` em 1–3 para jobs grandes** e aumente gradualmente — concorrência alta eleva o risco de rate limit em scrapes de canais grandes. --- # Sephora Scraper (Global) - **URL:** https://proooxy.com/pt/tools/sephora-scraper/ - **Tipo:** tools - **Descrição:** Ator Apify que extrai dados completos de produtos da Sephora — variantes, preços, imagens, ingredientes e reviews — de 21 lojas nos EUA, Canadá, 9 mercados da UE e 10 mercados da Ásia-Pacífico, em um único esquema normalizado. - **Resumo:** Extraia dados de qualquer loja Sephora — 21 mercados, um único ator. - **Categoria:** ecommerce - **Stack técnica:** Python, Crawlee, curl_cffi - **Mercados / regiões:** Estados Unidos, Canadá, França, Itália, Alemanha, Espanha, Polônia, República Tcheca, Grécia, Romênia, Portugal, Nova Zelândia, Austrália, Singapura, Malásia, Tailândia, Indonésia, Filipinas, Hong Kong, Taiwan, Brunei - **Estratégia anti-bot:** Bypass de Akamai via proxies residenciais + fingerprinting de TLS com curl_cffi - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/sephora - **Palavras-chave:** scraper sephora, dados de produtos sephora, api sephora, extrair produtos sephora, monitor de preços sephora, dados de produtos de beleza, extração de dados de cosméticos, scraper sephora global - **Publicado:** 2026-04-18 - **Modificado:** 2026-04-18 **Principais recursos:** - 21 lojas em um único ator — EUA, Canadá, 9 mercados da UE e 10 mercados APAC cobertos por um único SKU - Mercado detectado automaticamente — cole qualquer URL sephora.* e o dispatcher a encaminha para o módulo correto - Execuções multi-mercado combinadas — URLs de EUA + UE + SEA em uma única lista startUrls, transmitidas para um único dataset marcado com `market` - Precificação correta por locale — NZD, EUR, USD, AUD e outras 17 moedas retornadas pela própria camada de localização da Sephora - Esquema normalizado — todo mercado emite a mesma estrutura `source / brand / title / options / variants / medias / stats` - Isolamento de sessão por mercado — o estado de autenticação não pode se contaminar entre regiões - Circuit breaker global — 50 falhas consecutivas abortam a execução para evitar gastar computação em um alvo fora do ar **Casos de uso:** - Inteligência de preços pan-regional entre os mercados de beleza dos EUA, UE e APAC - Monitoramento de disponibilidade e sortimento de produtos entre mercados - Análise competitiva para marcas lançando em novas regiões da Sephora - Comparações de ingredientes entre formulações regionais - Rastreamento de reviews e avaliações — incluindo sinais de wishlist do SEA e resumos de sentimento por IA dos EUA - Auditorias de precificação de fidelidade/membership por mercado **Parâmetros de entrada:** - `startUrls` (array, obrigatório) — URLs de produto ou categoria de qualquer loja sephora.*. O mercado é detectado automaticamente pelo hostname. - `market` (string, opcional) — Substituição opcional de mercado (us, eu-fr, eu-it, eu-de, eu-es, eu-pl, eu-cz, eu-gr, eu-ro, eu-pt, sea-nz, sea-au, sea-sg, sea-my, sea-th, sea-id, sea-ph, sea-hk, sea-tw, sea-bn). - `locale` (string, opcional) — Locale BCP 47 opcional (ex.: fr-FR, en-NZ) — substitui o padrão do mercado. - `categoryIds` (array, opcional) — Somente UE. IDs de categoria SFCC como C479 — alternativa a colar URLs de categoria. - `proxy` (object, opcional) — Configuração de proxy do Apify. Residencial fortemente recomendado; fixe apifyProxyCountry no mercado-alvo. - `maxConcurrency` (number, opcional) — Requisições simultâneas. Padrão 5. EUA: 2-5. UE: 3. SEA: 8-16. - `maxRequestsPerCrawl` (number, opcional) — Limite rígido global entre todos os mercados. 0 = ilimitado. **FAQ:** **Q: Quais lojas da Sephora esse scraper suporta?** 21 lojas: EUA (sephora.com), Canadá (sephora.ca), 9 mercados da UE (FR, IT, DE, ES, PL, CZ, GR, RO, PT) e 10 mercados APAC (NZ, AU, SG, MY, TH, ID, PH, HK, TW, BN). O mercado é detectado automaticamente pelo hostname — nenhuma mudança de input é necessária ao misturar mercados. **Q: Posso raspar múltiplos mercados em uma única execução?** Sim. Misture URLs de sephora.com, sephora.fr e sephora.nz em uma única lista startUrls. O dispatcher as agrupa por mercado, executa cada módulo simultaneamente com a autenticação apropriada para cada mercado, e marca cada item do dataset com um campo `market`. **Q: Como o scraper lida com proteção anti-bot?** Ele usa proxies residenciais para todos os mercados e curl_cffi para fingerprinting de TLS no nível de navegador no tráfego de UE e SEA, para superar o Akamai. O tráfego dos EUA usa o HttpCrawler do Crawlee, com um pool de sessões que faz rotação em 403/429. **Q: Minhas configurações de execução v1.x dos EUA existentes vão continuar funcionando?** Sim. Os inputs pré-2.0 — startUrls, maxConcurrency, proxy, maxRequestsPerCrawl — se comportam de forma idêntica. A única mudança na saída é uma nova chave `market` em cada item, uma mudança aditiva e não destrutiva. **Q: Por que alguns campos estão nulos nos dados do SEA?** A API da Sephora SEA não expõe um contador `lovesCount`, então os itens APAC têm `stats.lovesCount = null`. Em vez disso, cada variante tem um campo booleano `wishlisted`. Por outro lado, `sentiments` (resumos de reviews por IA) e `source.crawlUrl` são exclusivos dos EUA. **Q: Preciso de tokens de API ou contas separadas por mercado?** Não. Seu token de API do Apify existente funciona sem alterações. O ator gerencia os guest tokens por mercado internamente — nenhuma credencial é necessária para UE/SEA, e os EUA funcionam com proxies residenciais padrão do Apify. ## Mercados suportados | Região | ID do Mercado | País | Moeda | Hostname | |---|---|---|---|---| | Américas | `us` | Estados Unidos | USD | sephora.com | | Américas | `us` | Canadá | CAD | sephora.ca | | UE | `eu-fr` | França | EUR | sephora.fr | | UE | `eu-it` | Itália | EUR | sephora.it | | UE | `eu-de` | Alemanha | EUR | sephora.de | | UE | `eu-es` | Espanha | EUR | sephora.es | | UE | `eu-pl` | Polônia | PLN | sephora.pl | | UE | `eu-cz` | República Tcheca | CZK | sephora.cz | | UE | `eu-gr` | Grécia | EUR | sephora.gr | | UE | `eu-ro` | Romênia | RON | sephora.ro | | UE | `eu-pt` | Portugal | EUR | sephora.pt | | APAC | `sea-nz` | Nova Zelândia | NZD | sephora.nz | | APAC | `sea-au` | Austrália | AUD | sephora.com.au | | APAC | `sea-sg` | Singapura | SGD | sephora.sg | | APAC | `sea-my` | Malásia | MYR | sephora.com.my | | APAC | `sea-th` | Tailândia | THB | sephora.co.th | | APAC | `sea-id` | Indonésia | IDR | sephora.co.id | | APAC | `sea-ph` | Filipinas | PHP | sephora.ph | | APAC | `sea-hk` | Hong Kong | HKD | sephora.hk | | APAC | `sea-tw` | Taiwan | TWD | sephora.tw | | APAC | `sea-bn` | Brunei | BND | sephora.bn | ## Exemplo de Saída ```json { "market": "sea-nz", "source": { "id": 58792, "canonicalUrl": "https://www.sephora.nz/products/rare-beauty-true-to-myself-natural-matte-longwear-foundation", "retailer": "SEPHORA", "currency": "NZD" }, "brand": "Rare Beauty", "title": "True To Myself Natural Matte Longwear Foundation", "description": "

A self-priming and self-setting foundation...

", "ingredients": "Aqua/Water, Cyclopentasiloxane, Glycerin...", "currentSku": "770225", "categories": ["makeup/face/foundation"], "options": [ { "name": "shade", "id": "66488", "values": [{"value": "1 Fair Neutral", "orderable": true}] } ], "variants": [ { "id": "276343", "sku": "770225", "price": { "current": 77.0, "original": 77.0, "stockStatus": "IN_STOCK" }, "options": [{"name": "shade", "value": "1 Fair Neutral"}], "highlights": ["NEW", "Only at Sephora"], "wishlisted": null } ], "medias": [{ "url": "https://www.sephora.nz/.../foundation-shade.jpg", "type": "image" }], "stats": { "reviewCount": 971, "rating": 4.8, "lovesCount": null } } ``` ## Dicas - **Fixe o país do proxy no mercado-alvo.** Uma saída residencial em um país incompatível é a maior fonte isolada de 403s vindos da camada Akamai da Sephora. Defina `apifyProxyCountry` para o código ISO da loja (`US`, `FR`, `NZ`, etc.). - **Faça um smoke test primeiro.** Defina `maxRequestsPerCrawl=10` antes da sua primeira execução de produção em um novo mercado. - **Ajuste a concorrência por região.** EUA: 2-5. UE: 3. SEA: 8-16. Cada mercado recebe seu próprio semáforo em execuções mistas. --- # Boohoo Scraper — Dados de Produtos em 7 Regiões - **URL:** https://proooxy.com/pt/tools/boohoo-scraper/ - **Tipo:** tools - **Descrição:** Extraia dados de produtos dos sites de e-commerce da Boohoo em 7 regiões, com paginação automática, filtragem por facetas e suporte a múltiplas moedas. - **Resumo:** Extraia dados de produtos da Boohoo em 7 lojas regionais. - **Categoria:** ecommerce - **Stack técnica:** TypeScript, Cheerio, Fingerprint Generator - **Mercados / regiões:** Países Baixos, Suécia, Reino Unido, Irlanda, França, Austrália, Estados Unidos - **Estratégia anti-bot:** Geração de fingerprint para bypass de anti-bot - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/boohoo-scraper - **Palavras-chave:** scraper boohoo, dados de produtos boohoo, monitoramento de preços boohoo, scraper de fast fashion, dados de catálogo de moda, dados de moda multi-região - **Publicado:** 2026-04-04 - **Modificado:** 2026-04-04 **Principais recursos:** - Suporte a 7 lojas regionais — Países Baixos (EUR), Suécia (SEK), Reino Unido (GBP), Irlanda (EUR), França (EUR), Austrália (AUD), Estados Unidos (USD) - Scraping de categorias e busca com paginação automática - Suporte a filtros por faceta — tamanho, cor, faixa de preço, estilo - Detalhes completos do produto, incluindo variantes e status de estoque - Geração de fingerprint de navegador para bypass de anti-bot - Precificação multi-moeda de acordo com a loja regional **Casos de uso:** - Análise de preços competitivos em fast fashion - Comparação de preços multi-região para os mesmos produtos - Monitoramento de tendências em moda acessível - Rastreamento de inventário e estoque entre regiões - Pesquisa de mercado de moda em mercados europeus e globais **Parâmetros de entrada:** - `startUrls` (array, obrigatório) — URLs de produto ou categoria da Boohoo - `maxRequestsPerCrawl` (number, opcional) — Limite de requisições (padrão: 5) - `maxConcurrency` (number, opcional) — Requisições paralelas (padrão: 5) - `proxy` (object, opcional) — Configuração de proxy **FAQ:** **Q: Quais lojas regionais da Boohoo são suportadas?** Países Baixos (EUR), Suécia (SEK), Reino Unido (GBP), Irlanda (EUR), França (EUR), Austrália (AUD) e Estados Unidos (USD). **Q: Posso filtrar produtos por tamanho ou cor?** Sim, o scraper suporta filtragem por faceta. Você pode fornecer URLs de categoria já filtradas, e o scraper vai respeitar os filtros aplicados. **Q: Como o scraper lida com paginação?** A paginação é automática. Forneça uma URL de categoria ou busca, e o scraper vai seguir todos os links de paginação para extrair cada produto. ## Exemplo de Saída ```json { "source": "https://www.boohoo.com/...", "brand": "boohoo", "title": "Oversized Hoodie", "description": "Stay cozy in this oversized hoodie...", "categories": ["Women", "Hoodies & Sweatshirts"], "price": { "current": 1500, "original": 3000, "currency": "GBP" }, "variants": [ { "sku": "BH-OH-BLK-S", "size": "S", "color": "Black", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Farfetch Scraper — Dados de Produtos de Moda de Luxo - **URL:** https://proooxy.com/pt/tools/farfetch-scraper/ - **Tipo:** tools - **Descrição:** Extraia dados de produtos de moda de luxo da Farfetch, incluindo precificação multi-moeda, variações de tamanho/caimento e recomendações de produtos. - **Resumo:** Extraia produtos de moda de luxo da Farfetch com suporte a múltiplas moedas. - **Categoria:** ecommerce - **Stack técnica:** TypeScript, Cheerio, Crawlee - **Mercados / regiões:** Global - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/farfetch - **Palavras-chave:** scraper farfetch, dados de produtos farfetch, dados de moda de luxo, scraper de moda de grife, monitoramento de preços farfetch, dados de varejo de luxo - **Publicado:** 2026-04-04 - **Modificado:** 2026-04-04 **Principais recursos:** - Scraping de páginas de categoria e de detalhes do produto - Precificação multi-moeda — detecta automaticamente com base na localização do proxy - Extração opcional de variações de tamanho/caimento - Até 90 produtos recomendados por item - Galerias de mídia completas e descrições detalhadas - Extração de marca, categoria e informações extras **Casos de uso:** - Inteligência de mercado de moda de luxo - Comparação de preços entre plataformas para marcas de grife - Análise de tendências de moda e descoberta de produtos - Precificação competitiva para varejistas multimarcas - Dados de treinamento para motores de recomendação de produtos **Parâmetros de entrada:** - `startUrls` (array, obrigatório) — URLs de produto ou categoria da Farfetch - `proxy` (object, opcional) — Configuração de proxy — a localização afeta a moeda - `maxRequestsPerCrawl` (number, opcional) — Limite de requisições (padrão: 100) - `maxConcurrency` (number, opcional) — Requisições paralelas (padrão: 5) - `withSizeFit` (boolean, opcional) — Inclui dados de tamanho/caimento (padrão: false) - `withRecommends` (boolean, opcional) — Inclui recomendações (padrão: false) **FAQ:** **Q: Como funciona a precificação multi-moeda?** A Farfetch exibe preços com base na sua localização. O scraper usa a localização do seu proxy para determinar qual moeda é retornada. Use um proxy dos EUA para USD, um proxy do Reino Unido para GBP, etc. **Q: Quantos produtos recomendados podem ser extraídos?** Até 90 produtos recomendados por item quando withRecommends está habilitado. Isso é útil para construir grafos de produtos e datasets de recomendação. ## Exemplo de Saída ```json { "source": "https://www.farfetch.com/shopping/...", "brand": "Gucci", "title": "GG Marmont Matelasse Shoulder Bag", "description": "Crafted from matelasse leather...", "details": ["Made in Italy", "100% Calf Leather"], "categories": ["Women", "Bags", "Shoulder Bags"], "options": [ { "name": "Size", "values": ["One Size"] } ], "variants": [ { "sku": "FF-GU-001", "price": 229000, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Global API Load Tester — Teste de Carga de 10K+ RPS - **URL:** https://proooxy.com/pt/tools/load-tester/ - **Tipo:** tools - **Descrição:** Ferramenta de teste de carga de alta performance que simula mais de 10,000 requisições por segundo, com tráfego geodistribuído, alvos ponderados e relatórios HTML interativos. - **Resumo:** Simule 10K+ RPS com testes de carga geodistribuídos. - **Categoria:** utility - **Stack técnica:** Go, Vegeta - **Mercados / regiões:** Global - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/global-api-load-tester - **Palavras-chave:** ferramenta de teste de carga de api, teste de carga http, ferramenta de teste de estresse, teste de performance, teste de carga 10k rps, teste de carga geodistribuído, teste de carga com vegeta - **Publicado:** 2026-04-04 - **Modificado:** 2026-04-04 **Principais recursos:** - Performance extrema — mais de 10,000 requisições por segundo - Testes geodistribuídos a partir de EUA, Europa e Ásia - Ataques multi-alvo ponderados (ex.: 90% leituras / 10% escritas) - Suporte a proxy residencial para tráfego realista - Pacing de taxa constante para evitar Coordinated Omission - Relatórios HTML interativos via Vegeta Plots - Métricas detalhadas de latência, throughput e erros **Casos de uso:** - Benchmarking de performance de API antes do lançamento - Planejamento de capacidade e dimensionamento de infraestrutura - Identificação de pontos de ruptura e gargalos - Testes de configurações de CDN e load balancer - Testes de latência geodistribuídos - Testes de regressão para endpoints críticos de performance **Parâmetros de entrada:** - `targets` (array, obrigatório) — Endpoints-alvo com URL, método, body, headers e peso - `rate` (number, opcional) — Requisições por segundo (padrão: 50) - `duration` (number, opcional) — Duração do teste em segundos (padrão: 60) - `geoDistribution` (array, opcional) — Regiões com códigos de país e pesos de tráfego - `useStickySessions` (boolean, opcional) — Mantém afinidade de sessão (padrão: true) - `maxCostLimit` (number, opcional) — Teto de custo para a execução do teste **FAQ:** **Q: Como funciona o teste geodistribuído?** Você especifica códigos de país e pesos de tráfego. A ferramenta distribui as requisições entre servidores de proxy do Apify nessas regiões, simulando padrões realistas de tráfego global. **Q: O que é Coordinated Omission?** É uma armadilha comum em testes de carga, na qual a ferramenta desacelera quando o alvo está sobrecarregado, fazendo os resultados parecerem melhores do que a realidade. O Vegeta usa pacing de taxa constante para evitar isso. **Q: Posso testar endpoints autenticados?** Sim, inclua headers de autorização na configuração do alvo. Cada alvo pode ter seus próprios headers, método e body. ## Exemplo de Saída O load tester gera relatórios HTML interativos e métricas estruturadas: ```json { "summary": { "totalRequests": 50000, "duration": "60s", "rps": 833.33, "successRate": 99.8, "latency": { "mean": "12.4ms", "p50": "10.1ms", "p95": "28.7ms", "p99": "89.2ms", "max": "342.1ms" }, "statusCodes": { "200": 49900, "503": 100 } } } ``` --- # Lululemon Scraper — Produtos, Variantes e Preços - **URL:** https://proooxy.com/pt/tools/lululemon-scraper/ - **Tipo:** tools - **Descrição:** Rastreie e extraia detalhes de produtos da Lululemon, incluindo dados de variantes, opções de cor, galerias de mídia e informações de preço. - **Resumo:** Extraia dados de produtos com variantes e mídia da Lululemon. - **Categoria:** ecommerce - **Stack técnica:** TypeScript, Crawlee - **Mercados / regiões:** Estados Unidos - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/lululemon-scraper - **Palavras-chave:** scraper lululemon, dados de produtos lululemon, monitor de preços lululemon, dados de produtos activewear, dados de preços athleisure, scraper de inventário lululemon - **Publicado:** 2026-04-04 - **Modificado:** 2026-04-04 **Principais recursos:** - Rastreamento de páginas de categoria e produto - Extração de variantes com opções de cor e tamanho - Galerias de mídia completas com imagens específicas por cor - Rastreamento de preços com saída estruturada - Extração de hierarquia de categorias - Leve e rápido, com o framework Crawlee **Casos de uso:** - Pesquisa de mercado e análise competitiva de roupas esportivas - Monitoramento de preços para revendedores e plataformas de comparação - Agregação de catálogo de produtos para e-commerce fitness - Rastreamento de disponibilidade de cor e tamanho - Análise de tendências em moda activewear **Parâmetros de entrada:** - `startUrls` (array, obrigatório) — URLs de produto ou categoria da Lululemon - `proxy` (object, opcional) — Configuração de proxy - `maxConcurrency` (number, opcional) — Limite de requisições paralelas **FAQ:** **Q: O scraper lida com diferentes variantes de cor?** Sim, cada variante de cor é extraída com suas próprias imagens, SKU e status de disponibilidade. A galeria de mídia é específica por cor. **Q: Posso raspar categorias inteiras da Lululemon?** Sim, forneça uma URL de categoria e o scraper vai rastrear todos os produtos dentro dela. ## Exemplo de Saída ```json { "source": "https://shop.lululemon.com/p/...", "brand": "lululemon", "title": "Align High-Rise Pant 25\"", "description": "Buttery-soft, weightless Nulu fabric...", "categories": ["Women", "Pants", "Yoga Pants"], "options": [ { "name": "Color", "values": ["Black", "True Navy", "Dark Olive"] }, { "name": "Size", "values": ["2", "4", "6", "8", "10", "12"] } ], "variants": [ { "sku": "LL-AHR-BLK-6", "name": "Black / 6", "price": 9800, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://...", "color": "Black" } ], "stats": { "rating": 4.7, "reviewCount": 15234 } } ``` --- # Schema Markup Scraper e Auditor de SEO - **URL:** https://proooxy.com/pt/tools/schema-markup-scraper/ - **Tipo:** tools - **Descrição:** Extraia JSON-LD, Microdata, RDFa, Open Graph e Twitter Cards de qualquer URL, com um sistema abrangente de pontuação de auditoria de SEO. - **Resumo:** Extraia dados estruturados e audite o SEO de qualquer site. - **Categoria:** utility - **Stack técnica:** TypeScript, Crawlee - **Mercados / regiões:** Global - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/metadata-scraper - **Palavras-chave:** verificador de schema markup, extrator de dados estruturados, extrator de json-ld, ferramenta de auditoria de seo, verificador de open graph, scraper de microdata, teste de rich results - **Publicado:** 2026-04-04 - **Modificado:** 2026-04-04 **Principais recursos:** - Extração de dados estruturados — JSON-LD, Microdata e RDFa - Meta tags sociais — Open Graph, Twitter Cards, Dublin Core - Análise de SEO com pontuação de 0 a 100 - Validação de URL canônica e hreflang - Extração de autor para sinais de EEAT - Detecção de LocalBusiness com mais de 80 subtipos - Auditoria de texto alternativo (alt text) de imagens - Validação de schema de breadcrumb - Extração de geo tags e NAP **Casos de uso:** - Auditoria técnica de SEO em escala - Validação de dados estruturados para sites - Análise competitiva de SEO — comparar schema markup entre concorrentes - Avaliação de sinais de EEAT para sites de conteúdo - Auditoria de SEO local para empresas - Validação de checklist de SEO pré-lançamento **Parâmetros de entrada:** - `startUrls` (array, obrigatório) — URLs a analisar - `proxy` (object, opcional) — Configuração de proxy - `maxRequestsPerCrawl` (number, opcional) — Limita o total de URLs a auditar - `maxConcurrency` (number, opcional) — Requisições paralelas - `extractMetaTags` (boolean, opcional) — Extrai meta tags (padrão: true) - `extractSeoAnalysis` (boolean, opcional) — Executa análise de SEO (padrão: true) - `computeSeoScore` (boolean, opcional) — Calcula pontuação de SEO de 0 a 100 (padrão: true) - `extractGeoData` (boolean, opcional) — Extrai geo tags e dados NAP **FAQ:** **Q: Quais formatos de dados estruturados são suportados?** JSON-LD, Microdata e RDFa. O scraper também extrai metadados de Open Graph, Twitter Cards e Dublin Core. **Q: Como a pontuação de SEO é calculada?** A pontuação de 0 a 100 avalia title tags, meta descriptions, hierarquia de headings, alt text de imagens, URLs canônicas, viewport mobile, presença de dados estruturados e mais. **Q: Posso auditar várias páginas de uma vez?** Sim, forneça várias URLs em startUrls. O scraper as processa em paralelo para uma auditoria em massa rápida. ## Exemplo de Saída ```json { "url": "https://example.com/product/...", "title": "Example Product Page", "linkedData": [ { "@type": "Product", "name": "..." } ], "openGraph": { "og:title": "Example Product", "og:type": "product" }, "twitterCard": { "card": "summary_large_image" }, "seoAudit": { "score": 78, "issues": [ "Missing alt text on 3 images", "No hreflang tags detected" ] }, "headings": { "h1": ["Example Product"], "h2": ["Description", "Reviews"] } } ``` --- # Sephora EU Scraper — 9 Mercados Europeus - **URL:** https://proooxy.com/pt/tools/sephora-eu-scraper/ - **Tipo:** tools - **Descrição:** Extraia dados completos de produtos da Sephora Europa em 9 mercados da UE, com extração multi-variante, bypass de Akamai WAF e gerenciamento inteligente de tokens. - **Resumo:** Extraia dados de produtos da Sephora em 9 mercados europeus. - **Categoria:** ecommerce - **Stack técnica:** TypeScript, Crawlee, Akamai Bypass - **Mercados / regiões:** França, Itália, Alemanha, Espanha, Polônia, República Tcheca, Grécia, Romênia, Portugal - **Estratégia anti-bot:** Akamai WAF — fingerprinting de TLS no nível de navegador - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/sephora-eu-scraper - **Palavras-chave:** scraper sephora europa, dados de produtos sephora eu, dados de beleza europeus, scraper sephora frança, scraper sephora alemanha, dados de cosméticos europeus, bypass de akamai waf - **Publicado:** 2026-04-04 - **Modificado:** 2026-04-04 **Principais recursos:** - Suporte a 9 mercados da UE — França, Itália, Alemanha, Espanha, Polônia, República Tcheca, Grécia, Romênia, Portugal - Extração multi-variante com preço e status de estoque individuais - Galerias de imagens em alta resolução para cada produto - Navegação por categoria via IDs de categoria para extração em massa - Fingerprinting de TLS no nível de navegador para superar o Akamai WAF - Gerenciamento de guest tokens com refresh automático e backoff exponencial **Casos de uso:** - Comparação de preços no mercado de beleza pan-europeu - Monitoramento de disponibilidade de produtos entre mercados - Pesquisa de expansão de mercado na UE para marcas de beleza - Inteligência competitiva entre mercados europeus - Análise de estratégia de precificação regional **Parâmetros de entrada:** - `startUrls` (array, opcional) — URLs de produtos da Sephora EU a raspar - `categoryIds` (array, opcional) — IDs de categoria para extração de produtos em massa - `locale` (string, opcional) — Locale do mercado-alvo (ex.: fr-FR, it-IT) - `maxProducts` (number, opcional) — Máximo de produtos a extrair - `maxConcurrency` (number, opcional) — Limite de requisições paralelas - `proxyConfiguration` (object, opcional) — Configurações de proxy — residencial recomendado **FAQ:** **Q: Quais mercados europeus da Sephora são suportados?** França (fr-FR), Itália (it-IT), Alemanha (de-DE), Espanha (es-ES), Polônia (pl-PL), República Tcheca (cs-CZ), Grécia (el-GR), Romênia (ro-RO) e Portugal (pt-PT). **Q: Como o scraper supera o Akamai WAF?** Ele usa fingerprinting de TLS no nível de navegador para imitar conexões de navegadores reais, tornando as requisições indistinguíveis do tráfego genuíno de usuários. **Q: Posso raspar categorias inteiras?** Sim, você pode fornecer IDs de categoria para extrair todos os produtos dentro dela. Essa é a forma mais eficiente de fazer extração em massa. ## Exemplo de Saída ```json { "source": "https://www.sephora.fr/p/...", "brand": "Rare Beauty", "title": "Soft Pinch Liquid Blush", "description": "Un blush liquide longue tenue...", "shortDescription": "Blush liquide", "categories": ["Maquillage", "Teint", "Blush"], "options": [ { "name": "Shade", "values": ["Joy", "Hope", "Grace"] } ], "variants": [ { "sku": "EU-RB-001", "name": "Joy", "price": 2800, "currency": "EUR", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ], "stats": { "rating": 4.7, "reviewCount": 3421 } } ``` --- # Shopify Scraper — Dados de Produtos de Qualquer Loja - **URL:** https://proooxy.com/pt/tools/shopify-scraper/ - **Tipo:** tools - **Descrição:** Ferramenta de nível profissional para extrair dados de produtos de alta fidelidade de qualquer loja baseada em Shopify, incluindo coleções, busca e recomendações de produtos. - **Resumo:** Extraia dados de produtos de qualquer loja Shopify. - **Categoria:** ecommerce - **Stack técnica:** TypeScript, got-scraping - **Mercados / regiões:** Global - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/shopify-scraper-ppe - **Palavras-chave:** scraper shopify, scraper de produtos shopify, raspar loja shopify, dados de produtos shopify, alternativa à api shopify, extração de dados de e-commerce, exportar produtos shopify, scraper de coleções shopify - **Publicado:** 2026-04-04 - **Modificado:** 2026-04-04 **Principais recursos:** - Universal — funciona com qualquer loja baseada em Shopify - Extração de catálogo completo da loja e suporte a busca - Recomendações de produtos (até 20 por produto) - Scraping de coleções e produtos individuais - Extração de tags e categorias - Normalização de moeda (preços x100) para precisão **Casos de uso:** - Pesquisa de mercado em lojas Shopify de qualquer nicho - Análise competitiva para marcas DTC - Agregação de catálogo de produtos para plataformas de comparação - Monitoramento de tendências em lojas de e-commerce independentes - Construção de datasets de recomendação de produtos - Monitoramento de preços para revendedores **Parâmetros de entrada:** - `startUrls` (array, obrigatório) — URLs de loja Shopify — produto, coleção ou home da loja - `proxy` (object, opcional) — Proxy residencial recomendado para melhores resultados - `maxRequestsPerCrawl` (number, opcional) — Limite de requisições (padrão: 100) - `maxRecommendationsPerProduct` (number, opcional) — Produtos recomendados a buscar (padrão: 0, máximo: 20) - `query` (string, opcional) — Consulta de busca para encontrar produtos dentro de uma loja **FAQ:** **Q: Isso funciona com qualquer loja Shopify?** Sim, o scraper funciona com qualquer loja baseada em Shopify. Ele aproveita a estrutura de dados de produto padrão da Shopify, que é consistente em todas as lojas. **Q: Posso buscar produtos específicos?** Sim, use o parâmetro query para buscar dentro de uma loja específica. Isso é útil para encontrar tipos específicos de produto sem raspar o catálogo inteiro. **Q: Como as recomendações de produtos são extraídas?** Defina maxRecommendationsPerProduct para buscar produtos relacionados. Até 20 recomendações estão disponíveis por produto, úteis para construir grafos de produtos. ## Exemplo de Saída ```json { "source": "https://store.example.com/products/...", "brand": "Example Brand", "title": "Premium Organic Cotton T-Shirt", "description": "Made from 100% organic cotton...", "categories": ["Tops", "T-Shirts"], "tags": ["organic", "sustainable", "cotton"], "options": [ { "name": "Size", "values": ["S", "M", "L", "XL"] }, { "name": "Color", "values": ["White", "Black", "Navy"] } ], "variants": [ { "sku": "SHOP-OCT-WHT-M", "name": "White / M", "price": 4500, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Ulta Beauty Scraper — Produtos, Preços e SKUs - **URL:** https://proooxy.com/pt/tools/ulta-scraper/ - **Tipo:** tools - **Descrição:** Extraia detalhes de produtos, preços, imagens e informações de SKU da Ulta Beauty, incluindo páginas de categoria, páginas de marca e seções de promoção. - **Resumo:** Extraia dados completos de produtos da Ulta Beauty. - **Categoria:** ecommerce - **Stack técnica:** TypeScript, Cheerio, Crawlee - **Mercados / regiões:** Estados Unidos - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/ulta-scraper - **Palavras-chave:** scraper ulta, scraper ulta beauty, dados de produtos ulta, monitor de preços ulta, scraper de sku ulta, monitoramento de promoções ulta, dados de varejo de beleza - **Publicado:** 2026-04-04 - **Modificado:** 2026-04-04 **Principais recursos:** - Suporta páginas de categoria, detalhe de produto, marca e promoção - Detalhes completos do produto com preços, descrições e imagens - Extração de dados em nível de SKU com agrupamento de variantes - Detecção automática do tipo de página a partir da URL - Parsing leve baseado em Cheerio, para velocidade - Agrupa SKUs relacionados sob o mesmo produto **Casos de uso:** - Análise competitiva no setor de beleza — precificação Ulta vs. Sephora - Construção de catálogo de produtos para plataformas de comparação de compras - Monitoramento de vendas e promoções - Descoberta de marcas e rastreamento de presença de mercado - Monitoramento de inventário em nível de SKU **Parâmetros de entrada:** - `startUrls` (array, obrigatório) — URLs de produto, categoria, marca ou promoção da Ulta - `proxy` (object, opcional) — Configuração de proxy - `maxConcurrency` (number, opcional) — Máximo de requisições paralelas - `maxRequestsPerCrawl` (number, opcional) — Limita o total de requisições por execução **FAQ:** **Q: Quais tipos de página da Ulta podem ser raspadas?** O scraper suporta páginas de detalhe de produto, páginas de listagem de categoria, páginas de marca e páginas de promoção. Ele detecta automaticamente o tipo de página a partir da URL. **Q: Como as variantes de produto são tratadas?** Variantes (tonalidades e tamanhos diferentes) são agrupadas sob o mesmo produto pai. Cada variante inclui seu próprio SKU, preço e status de disponibilidade. ## Exemplo de Saída ```json { "source": "https://www.ulta.com/p/...", "brand": "NYX Professional Makeup", "title": "Butter Gloss", "description": "A buttery soft and silky lip gloss...", "categories": ["Makeup", "Lips", "Lip Gloss"], "variants": [ { "sku": "ULTA-NYX-BG-001", "name": "Angel Food Cake", "price": 900, "currency": "USD", "inStock": true } ], "stats": { "rating": 4.5, "reviewCount": 8932 } } ``` --- # Universal Web Printer — URL e HTML para PDF, Imagem - **URL:** https://proooxy.com/pt/tools/web-printer/ - **Tipo:** tools - **Descrição:** Converta qualquer URL ou HTML em PDF, PNG, JPEG ou WebP, com scroll-stitch inteligente, extração de elementos, criptografia de PDF e marca d'água. - **Resumo:** Converta URLs e HTML em PDF, PNG, JPEG ou WebP. - **Categoria:** utility - **Stack técnica:** TypeScript, Playwright, PDF-lib, Sharp - **Mercados / regiões:** Global - **Taxa de sucesso reportada:** >99% - **Página no Apify:** https://apify.com/autofacts/universal-web-printer - **Palavras-chave:** api html para pdf, conversor de url para pdf, api de screenshot de site, converter página web em pdf, converter url em imagem, converter página web em png, api de geração de pdf - **Publicado:** 2026-04-04 - **Modificado:** 2026-04-04 **Principais recursos:** - Saída multi-formato — PDF, PNG, JPEG, WebP - Múltiplos modos de visualização — viewport, página inteira, seletor CSS, readability - Scroll-stitch inteligente para capturas precisas de página inteira - Extração em nível de elemento via seletores CSS - Manipulação de página — remover elementos, clicar em botões, injetar CSS, ocultar cabeçalhos fixos - Criptografia de PDF (RC4 128-bit) e marca d'água - Mesclagem de PDF para documentos multi-página - Configuração personalizada de viewport e fator de escala **Casos de uso:** - Geração automatizada de relatórios a partir de dashboards web - Arquivamento e documentação de sites - Snapshots para testes de regressão visual - Screenshots de páginas de produto de e-commerce para catálogos - Conformidade legal — capturar conteúdo web como evidência - Geração de PDFs a partir de aplicações web **Parâmetros de entrada:** - `startUrls` (array, opcional) — URLs a renderizar - `htmlContent` (string, opcional) — HTML bruto a renderizar - `outputFormat` (string, opcional) — pdf, png, jpeg ou webp (padrão: pdf) - `viewMode` (string, opcional) — viewport, fullPage, selector ou readability - `targetSelector` (string, opcional) — Seletor CSS para captura em nível de elemento - `viewportWidth` (number, opcional) — Largura do viewport do navegador (padrão: 1280) - `viewportHeight` (number, opcional) — Altura do viewport do navegador (padrão: 720) - `removeSelectors` (array, opcional) — Seletores CSS de elementos a remover antes da captura - `pdfPassword` (string, opcional) — Criptografa o PDF com criptografia RC4 128-bit **FAQ:** **Q: Posso capturar só um elemento específico da página?** Sim, use o parâmetro targetSelector com um seletor CSS para capturar apenas um elemento específico. Por exemplo, use '#main-content' para capturar somente a área de conteúdo principal. **Q: Como funciona o scroll-stitch inteligente?** Para capturas de página inteira, a ferramenta rola a página em incrementos, capturando cada fatia do viewport, e depois as costura (stitch) juntas. Isso garante que conteúdo com lazy-loading e animações sejam capturados corretamente. **Q: Posso remover banners de cookies ou anúncios antes da captura?** Sim, use removeSelectors para especificar seletores CSS de elementos a remover. Você também pode usar hideFixedElements para ocultar cabeçalhos fixos (sticky) e elementos flutuantes. ## Exemplo de Saída A ferramenta gera arquivos no formato escolhido (PDF, PNG, JPEG ou WebP) e os armazena no dataset do Apify. Cada saída inclui metadados: ```json { "url": "https://example.com", "format": "pdf", "fileName": "example-com.pdf", "fileSize": 245832, "viewMode": "fullPage", "viewport": { "width": 1280, "height": 720 }, "encrypted": false } ``` --- # Boas Práticas de Web Scraping em 2026: Um Guia Prático - **URL:** https://proooxy.com/pt/blog/web-scraping-best-practices-2026/ - **Tipo:** blog - **Descrição:** Estratégias de web scraping testadas em batalha, com mais de 12 anos de experiência em produção — padrões de arquitetura, tratamento de erros, gerenciamento de proxies e normalização de saída. - **Palavras-chave:** boas práticas de web scraping, scraping de produção, guia de extração de dados, arquitetura de scraper, como fazer web scraping, gerenciamento de proxy para scraping, tratamento de erros em scraping - **Publicado:** 2026-04-01 - **Modificado:** 2026-04-01 Depois de construir e manter 15 scrapers de produção que atendem mais de 3,100 usuários com taxas de sucesso acima de 99%, aqui estão as práticas que realmente importam. ## Arquitetura: Pense em Pipelines, Não em Scripts O maior erro que vejo é tratar o scraping como um processo de etapa única. Scrapers de produção são pipelines de dados: 1. **Descoberta de URLs** — encontrar o que raspar (sitemaps, páginas de categoria, busca, APIs) 2. **Execução de Requisições** — buscar os dados com retry e rotação adequados 3. **Parsing** — extrair campos estruturados a partir das respostas brutas 4. **Normalização** — limpar, validar e padronizar a saída 5. **Armazenamento** — enviar para datasets, bancos de dados ou sistemas downstream Cada etapa deve ser testável e reexecutável de forma independente. Quando a Sephora muda o layout da página de produto, só a etapa 3 precisa ser atualizada — o resto do pipeline permanece estável. ## Sempre Prefira APIs em Vez de Parsing de HTML Antes de escrever um único seletor CSS, verifique se o site tem: - **APIs públicas** — endpoints documentados que retornam JSON - **APIs privadas** — chamadas XHR/fetch visíveis no DevTools do navegador - **Endpoints GraphQL** — cada vez mais comuns, muitas vezes com introspection habilitada - **JSON embutido** — `__NEXT_DATA__`, `window.__INITIAL_STATE__`, ou JSON-LD no HTML Respostas de API são estruturadas, versionadas e muito mais estáveis do que layouts HTML. Meu [Sephora scraper](/pt/tools/sephora-scraper/) converte toda URL da web em uma chamada de API — ele nunca quebrou por causa de um redesign de frontend. ## Estratégia de Proxy: Corresponda à Proteção Nem todo site precisa de proxies residenciais. Aqui está o meu framework de decisão: | Nível de Proteção | Tipo de Proxy | Sites de Exemplo | |-----------------|------------|---------------| | Nenhuma / Básica | Datacenter | A maioria das lojas Shopify, sites pequenos | | Rate limiting | Datacenter rotativo | E-commerce médio, sites de conteúdo | | Fingerprinting | Residencial | Sephora, Farfetch, grandes marcas | | WAF avançado | Residencial + fingerprint de TLS | Akamai, Cloudflare Enterprise | O insight principal: **o custo do proxy escala com o nível de proteção**. Não gaste dinheiro com proxies residenciais em sites que só verificam reputação de IP. Meu [Shopify scraper](/pt/tools/shopify-scraper/) funciona bem com proxies de datacenter porque a proteção padrão da Shopify é mínima. ## Gerenciamento de Sessão É Tudo A diferença entre uma taxa de sucesso de 60% e de 99% costuma ser o gerenciamento de sessão: - **Alterne sessões, não só IPs** — um IP novo com os mesmos cookies parece suspeito - **Aqueça as sessões** — visite a homepage antes de acessar páginas de produto - **Respeite os rate limits** — 5 requisições simultâneas vencem 50 que são bloqueadas - **Backoff exponencial** — retries de 1s, 2s, 4s, 8s, nunca retries imediatos Meu [Sephora EU scraper](/pt/tools/sephora-eu-scraper/) gerencia guest tokens com refresh automático e backoff exponencial. Ele mantém sessões persistentes que se parecem com padrões reais de navegação. ## Normalize a Sua Saída Dados brutos de scraping são bagunçados. Normalize tudo: ### Preços Armazene como inteiros (centavos, não dólares). `$29.99` vira `2999`. Isso evita erros de precisão de ponto flutuante que corrompem dados financeiros mais adiante no pipeline. Todos os meus scrapers de e-commerce usam essa convenção. ### URLs Sempre armazene URLs absolutas, nunca caminhos relativos. Resolva-as no momento da extração. ### Datas ISO 8601 (`2026-04-01T00:00:00Z`), sempre com timezone. Nunca armazene datas formatadas por locale. ### Texto Remova espaços em branco excedentes, normalize Unicode e defina uma política para lidar com HTML (remover tags vs. preservar formatação). ## Tratamento de Erros: Espere Falhas Scrapers de produção falham o tempo todo — a questão é o quão bem. Minha abordagem: ``` Request fails (network error, timeout, 4xx/5xx) → Retry with exponential backoff (up to 5 attempts) → Rotate session/proxy on retry → Log failure with full context if all retries exhausted → Continue processing remaining URLs (don't crash the batch) ``` Acompanhe as taxas de sucesso por padrão de URL. Se as páginas `/category/*` caírem repentinamente abaixo de 90% de sucesso, o site provavelmente mudou algo — você vai perceber antes que os usuários reportem. ## Monitore e Alerte Um scraper sem monitoramento é um scraper esperando para falhar silenciosamente. Acompanhe: - **Taxa de sucesso** por execução e por padrão de URL - **Contagem de saída** — quedas repentinas significam que algo quebrou - **Qualidade dos dados** — campos nulos, valores inesperados, violações de esquema - **Custo** — uso de proxy, tempo de computação, armazenamento Todos os meus atores Apify expõem essas métricas. Quando as taxas de sucesso caem, sou notificado em questão de horas — muitas vezes antes que qualquer usuário perceba. ## Comece Simples, Adicione Complexidade Todo scraper que eu construo começa como a coisa mais simples que funciona: 1. **HTTP + Cheerio** primeiro (mais rápido, mais barato) 2. **Adicione fingerprinting** só se for bloqueado 3. **Adicione renderização em navegador** só se JavaScript for necessário 4. **Adicione rotação de proxy** só se houver rate limiting Meu [Ulta scraper](/pt/tools/ulta-scraper/) é Cheerio puro — sem necessidade de navegador. Meu [Universal Web Printer](/pt/tools/web-printer/) usa Playwright porque precisa renderizar JavaScript. A ferramenta certa para cada trabalho. --- Esses não são princípios teóricos — eles vêm da operação real de scrapers de produção que processam milhões de requisições. Se você precisa de um scraper personalizado construído com essas práticas, [vamos conversar](/pt/contact/). --- # Entendendo a Proteção Anti-Bot: O Que Funciona em 2026 - **URL:** https://proooxy.com/pt/blog/bypassing-anti-bot-protection-guide/ - **Tipo:** blog - **Descrição:** Um mergulho técnico nos sistemas anti-bot modernos — Cloudflare, Akamai, Datadome — e nas técnicas legítimas de bypass usadas em scraping de produção. - **Palavras-chave:** bypass de anti-bot, bypass cloudflare, bypass akamai, bypass datadome, detecção de bots, proteção contra web scraping, fingerprint tls scraping, como burlar captcha - **Publicado:** 2026-03-15 - **Modificado:** 2026-03-15 A proteção anti-bot é uma corrida armamentista. Como alguém que constrói scrapers de produção que superam esses sistemas todos os dias, aqui está a visão de um profissional sobre o cenário — o que as proteções realmente verificam e como são as técnicas legítimas de bypass. ## As Camadas de Detecção Sistemas anti-bot modernos operam em camadas. Entender essas camadas é a chave para um bypass confiável: ### Camada 1: Reputação de IP A verificação mais simples. Serviços anti-bot mantêm bancos de dados de faixas de IP conhecidas de datacenters, saídas de VPN e IPs previamente sinalizados. **O que eles verificam:** - Esse IP é da AWS, GCP, Azure ou de outro provedor de hospedagem conhecido? - Esse IP já foi sinalizado por atividade de bot antes? - Quantas requisições vieram desse IP recentemente? **Contramedida:** Proxies residenciais de serviços como Apify Proxy ou Bright Data fornecem endereços IP que pertencem a provedores de internet reais, tornando-os indistinguíveis de usuários comuns no nível de IP. ### Camada 2: TLS Fingerprinting É aqui que fica interessante. Todo cliente HTTP tem uma assinatura de handshake TLS única baseada em: - Cipher suites suportadas e sua ordem - Extensões TLS e sua ordem - Versões de TLS suportadas - Protocolos ALPN Uma biblioteca padrão como `axios` ou `requests` tem um fingerprint de TLS que grita "bot" porque não corresponde a nenhum navegador real. Serviços como Akamai e Cloudflare mantêm bancos de dados de fingerprints para cada versão de navegador. **Contramedida:** Bibliotecas como `got-scraping` (usada pelo meu [Shopify scraper](/pt/tools/shopify-scraper/)) e clientes TLS especializados conseguem imitar fingerprints de TLS no nível de um navegador real. Meu [Sephora EU scraper](/pt/tools/sephora-eu-scraper/) usa fingerprinting de TLS no nível de navegador para superar o Akamai WAF. ### Camada 3: HTTP/2 Fingerprinting Além do TLS, as configurações de HTTP/2 revelam o tipo de cliente: - Parâmetros do frame SETTINGS (tamanho da tabela de headers, número máximo de streams simultâneos) - Valores do frame WINDOW_UPDATE - Estrutura da árvore de prioridades - Padrões de compressão de headers (HPACK) Cada navegador tem configurações de HTTP/2 características. Chrome, Firefox e Safari têm aparências diferentes nesse nível. ### Camada 4: Desafios de JavaScript A página "checking your browser" do Cloudflare e desafios similares executam JavaScript que: - Verifica APIs do navegador (canvas, WebGL, AudioContext) - Mede o tempo de execução - Valida propriedades do DOM - Envia as respostas do desafio de volta ao servidor **Contramedida:** Navegadores headless (Playwright, Puppeteer) executam esses desafios nativamente. O segredo é garantir que seu navegador headless não vaze sinais de automação (mais sobre isso adiante). ### Camada 5: Análise Comportamental A camada mais sofisticada. Esses sistemas analisam: - Padrões de movimento do mouse (muito linear = bot) - Comportamento de rolagem (scroll instantâneo até o fim = bot) - Tempo entre ações (muito consistente = bot) - Padrões de navegação (ir direto para páginas de produto sem navegar antes = suspeito) - Cadência de requisições (intervalos perfeitamente uniformes = bot) ## Perfis de Proteção: Saiba o Que Você Está Enfrentando ### Cloudflare **Comum em:** Sites pequenos e médios, blogs, APIs O Cloudflare oferece vários níveis de proteção: - **Basic** — reputação de IP + rate limiting. Proxies de datacenter que respeitam o rate limit geralmente funcionam. - **Managed Challenge** — desafio de JavaScript + turnstile. Exige navegador ou um resolvedor de desafios. - **Enterprise/Bot Management** — análise comportamental completa + fingerprinting. Exige proxy residencial + fingerprinting adequado. ### Akamai Bot Manager **Comum em:** E-commerce corporativo (Sephora EU, grandes varejistas) O Akamai é um dos mais difíceis de superar por causa de: - Fingerprinting de TLS agressivo - Coleta de dados de sensores via JavaScript no lado do cliente - Análise comportamental em nível de sessão - Verificação de integridade de cookies Minha abordagem para o Akamai: fingerprinting de TLS no nível de navegador + gerenciamento de guest tokens + pacing de requisições que imita a navegação humana. ### Datadome **Comum em:** E-commerce, venda de ingressos O Datadome foca em: - Fingerprinting de dispositivo via JavaScript - Desafios de CAPTCHA para tráfego suspeito - Pontuação comportamental em tempo real ### PerimeterX (agora HUMAN) **Comum em:** Varejo, serviços financeiros Conhecido por desafios agressivos de JavaScript e análise comportamental. ## Arquitetura de Bypass Legítimo Para sistemas de produção que precisam de extração de dados confiável e contínua, este é o padrão de arquitetura que eu uso: ### 1. Abordagem API-First Antes de tentar superar qualquer proteção, verifique se existe um caminho via API que evite o WAF por completo. Muitas proteções se aplicam apenas a endpoints voltados ao navegador, não a rotas de API. Meu [Sephora scraper](/pt/tools/sephora-scraper/) converte toda URL da web em uma chamada de API. Os endpoints de API têm proteção mais leve do que o site porque foram projetados para aplicativos mobile. ### 2. Aquecimento de Sessão Não pule direto para a página de dados. Construa uma sessão de navegação realista: ``` Visit homepage → Browse categories → View product listing → Access product detail ``` Cada etapa constrói a credibilidade da sessão. O sistema anti-bot enxerga um padrão que corresponde ao comportamento de um usuário real. ### 3. Consistência de Fingerprint Isso é crítico: seu fingerprint precisa ser **internamente consistente**. Se o seu TLS diz "Chrome 120" mas o seu User-Agent diz "Chrome 118", isso é um sinal de detecção. Alinhe: - Fingerprint de TLS - Configurações de HTTP/2 - Header User-Agent - Accept-Language e outros headers - Propriedades do navegador em JavaScript (se estiver usando headless) ### 4. Pacing de Requisições Humanos reais não fazem requisições em intervalos precisos de 1 segundo. Introduza uma variação realista: - Delay base entre requisições (2-5 segundos) - Jitter aleatório (+/- 30%) - Pausas mais longas após eventos de navegação - Períodos ocasionais de "ociosidade" ### 5. Degradação Graciosa Ao encontrar um desafio ou bloqueio: 1. Não tente novamente de imediato — isso confirma comportamento de bot 2. Recue exponencialmente (backoff exponencial) 3. Alterne para uma sessão nova (novo IP + novos cookies) 4. Tente uma região de proxy diferente 5. Se persistir, mude para uma abordagem baseada em navegador ## O Que Não Funciona Mais - **Só trocar o User-Agent** — sistemas de detecção verificam dezenas de sinais, não apenas um header - **Apenas delays aleatórios** — sem um fingerprinting adequado, o timing não ajuda - **Chrome headless com configurações padrão** — sinais de automação vazam por todo lado (`navigator.webdriver`, plugins ausentes, artefatos do Chrome DevTools Protocol) - **Reutilização de cookies** — sistemas modernos vinculam cookies a fingerprints de TLS e faixas de IP ## Considerações Éticas O bypass de anti-bot é uma ferramenta. Como qualquer ferramenta, pode ser usada com responsabilidade ou sem ela. **Casos de uso legítimos:** - Comparação de preços em benefício do consumidor - Pesquisa de mercado com dados públicos - Acessibilidade (disponibilizar dados em formatos estruturados) - Pesquisa acadêmica - Garantia de qualidade e monitoramento **Sempre respeite:** - As diretivas do robots.txt - Os rate limits (mesmo que consiga ultrapassá-los, não o faça) - As regulações de dados pessoais (GDPR, CCPA) - Os termos de serviço (entenda o panorama legal da sua jurisdição) Todas as minhas [ferramentas](/pt/tools/) são projetadas para extração de dados legítima, com rate limiting embutido e boas práticas de proxy. --- Entender os sistemas anti-bot faz de você um engenheiro de scraping melhor. Se você precisa de scrapers de nível de produção que lidam com esses desafios de forma confiável, dê uma olhada nas minhas [ferramentas](/pt/tools/) ou [entre em contato](/pt/contact/) para um projeto sob medida. --- # Contato - **URL:** https://proooxy.com/pt/contact/ - **Tipo:** page - **Descrição:** Encomende um scraper personalizado ou um pipeline de dados para RAG — APIs privadas via engenharia reversa, bypass de anti-bot e JSON limpo e estruturado entregue direto na sua stack de IA. - **Palavras-chave:** contratar desenvolvedor de web scraping, desenvolvimento de scraper sob medida, serviço de web scraping, pipeline de dados para rag, serviço de extração de dados, consultor de web scraping - **Publicado:** 0001-01-01 - **Modificado:** 0001-01-01 ## Consiga dados que não estão no catálogo Desenvolvo web scrapers sob medida e pipelines de dados para RAG — para equipes de IA, plataformas de dados e qualquer pessoa que precise da web aberta como JSON limpo e estruturado. Extração pontual ou feed continuamente atualizado, posso ajudar. ### O que eu desenvolvo - **Scrapers personalizados** — desenvolvidos sob medida para seus sites-alvo, com bypass de anti-bot já embutido - **Pipelines de dados para RAG** — extração, normalização, chunking e entrega de JSON pronto para recuperação no seu vector store ou warehouse - **Engenharia reversa de APIs privadas** — transformo endpoints não documentados de mobile/web em fontes estáveis e estruturadas - **Manutenção de scrapers** — mantenho extratores existentes funcionando quando os sites-alvo mudam - **Consultoria técnica** — revisão de arquitetura para sua stack de scraping e ingestão de dados ### Como funciona 1. **Descreva os dados** — a fonte, os campos que você precisa e o formato de entrega 2. **Avaliação de viabilidade gratuita** — avalio a complexidade do alvo e sua proteção anti-bot sem custo 3. **Proposta e cronograma** — escopo claro, preço fixo, data de entrega 4. **Desenvolvimento e entrega** — extrator de nível de produção com documentação e saída limpa ### Inicie um projeto
### Ou fale comigo diretamente - **E-mail**: [p8p9cmk96@mozmail.com](mailto:p8p9cmk96@mozmail.com) - **GitHub**: [@autofacts](https://github.com/autofacts) - **Apify**: [apify.com/autofacts](https://apify.com/autofacts) --- # Sobre - **URL:** https://proooxy.com/pt/about/ - **Tipo:** page - **Descrição:** Richard Feng — engenheiro de web scraping com mais de 12 anos de experiência. Transformo sites protegidos em dados estruturados, limpos e prontos para RAG para agentes de IA, pipelines de recuperação e LLMs. - **Palavras-chave:** engenheiro de web scraping, consultor de extração de dados, desenvolvimento de scraper sob medida, especialista em bypass de anti-bot, consultor de pipeline de dados para rag, engenharia reversa de api - **Publicado:** 0001-01-01 - **Modificado:** 0001-01-01 ## Quem eu sou Sou Richard Feng, engenheiro freelancer de automação web com mais de 12 anos de experiência em programação. Sou especializado em **web scraping, extração de dados e engenharia reversa de APIs** — transformando sites complexos e protegidos em dados limpos e estruturados que sistemas de IA realmente conseguem usar. Meu conjunto de ferramentas abrange **Node.js (TypeScript), Python, Go e Java**, com profundo conhecimento em **Crawlee, Playwright e Cheerio**. Já construí sistemas de produção que processam milhões de requisições com **>99% de sucesso**. ## O que eu faço Desenvolvo e mantenho **16 atores Apify de nível de produção** que atendem mais de **3,100 usuários** com uma taxa consistente de **>99% de sucesso nas execuções**. Cada ator gera **JSON limpo e pronto para RAG** — com esquema consistente, deduplicado e pronto para uso em um vector store, pipeline de recuperação ou conjunto de treinamento. A maioria dos atores de dados públicos não exige chave de API. Meu trabalho abrange quatro áreas: ### Dados de e-commerce e varejo Scrapers para as principais plataformas de beleza e moda, incluindo [Sephora](/pt/tools/sephora-scraper/) (21 lojas ao redor do mundo), [Ulta Beauty](/pt/tools/ulta-scraper/), [Farfetch](/pt/tools/farfetch-scraper/), [Lululemon](/pt/tools/lululemon-scraper/), [Boohoo](/pt/tools/boohoo-scraper/), [Macy's](/pt/tools/macys-scraper/), e um [scraper universal para Shopify](/pt/tools/shopify-scraper/) que funciona com qualquer loja baseada em Shopify. ### Dados públicos, financeiros e jurídicos Datasets oficiais dos EUA em JSON limpo e pronto para RAG — [arquivos SEC EDGAR e dados financeiros XBRL](/pt/tools/sec-edgar-scraper/), [concessões federais do USAspending.gov](/pt/tools/usaspending-scraper/), [decisões judiciais do CourtListener](/pt/tools/courtlistener-scraper/), e [estudos do ClinicalTrials.gov](/pt/tools/clinical-trials-scraper/). ### Inteligência de redes sociais e mídia Posts, perfis e interações do [Bluesky](/pt/tools/bluesky-scraper/) via AT Protocol, além de um [scraper de legendas e transcrições do YouTube](/pt/tools/youtube-transcript-scraper/) que gera JSON, SRT, VTT ou texto pronto para LLM em mais de 100 idiomas. ### Utilitários para desenvolvedores Ferramentas além do scraping — [auditoria de SEO e dados estruturados](/pt/tools/schema-markup-scraper/), [renderização de páginas em PDF/imagem](/pt/tools/web-printer/), e [testes de carga de alta performance](/pt/tools/load-tester/). ## Especialidades - **Engenharia reversa de APIs privadas** — transformando endpoints não documentados de mobile/web em fontes de dados confiáveis - **Bypass de anti-bot** — Cloudflare, DataDome, Akamai WAF e proteções personalizadas - **Saída pronta para RAG** — JSON normalizado e com esquema consistente, construído para recuperação e grounding - **Scraping multi-região** — locales, moedas e compliance sob controle - **Sistemas de alta confiabilidade** — extratores que mantêm >99% de sucesso em escala ## Stack técnica | Categoria | Tecnologias | |----------|-------------| | Linguagens | TypeScript, Python, Go, Java | | Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping | | Anti-bot | Fingerprint generators, TLS fingerprinting, session rotation | | Infraestrutura | Apify Platform, Docker, GitHub Actions | | Testes | Vegeta, custom load-testing frameworks | ## Trabalhe comigo Ofereço soluções de scraping sob medida, engenharia de pipelines de dados para RAG e serviços contínuos de extração de dados. Se a sua IA precisa da web real como dados limpos — [vamos conversar](/pt/contact/). ---