# Proooxy — веб-данные, готовые к RAG, для ИИ-агентов и LLM — Полное содержимое (llms-full.txt) > Структурированные веб-данные, готовые к RAG, для ИИ-агентов, retrieval-конвейеров и LLM. Ричард Фэн создаёт производственные акторы Apify для e-commerce, отчётности SEC/EDGAR, федеральных расходов США, судебных решений, клинических исследований, а также социальных и видеоданных — обход антибот-защиты, чистый JSON с единой схемой, без API-ключей для открытых данных. Этот файл — объединение всех публичных страниц https://proooxy.com/ru/ в единый документ, предназначенный для прямой загрузки в LLM и ИИ-агенты. Перед каждой страницей идет блок фактов из структурированного front matter (URL, тип, категория, технология, регионы, даты), за которым следует полный текст страницы в формате Markdown. Генерируется автоматически с действующего сайта. --- ## Метаданные сайта - **Сайт:** Proooxy — веб-данные, готовые к RAG, для ИИ-агентов и LLM - **URL:** https://proooxy.com/ru/ - **Описание:** Структурированные веб-данные, готовые к RAG, для ИИ-агентов, retrieval-конвейеров и LLM. Ричард Фэн создаёт производственные акторы Apify для e-commerce, отчётности SEC/EDGAR, федеральных расходов США, судебных решений, клинических исследований, а также социальных и видеоданных — обход антибот-защиты, чистый JSON с единой схемой, без API-ключей для открытых данных. - **Автор:** Richard Feng - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **Инструменты:** 17 производственных акторов - **Статьи:** 2 - **Последняя генерация:** 2026-08-04 --- ## Индекс каталога инструментов - [Macy's Scraper — товары, цены, SKU и новости](https://proooxy.com/ru/tools/macys-scraper/) — Товары, цены, SKU/UPC и новости Macy's — устойчиво к Akamai, без браузера. - [Bluesky Scraper — посты, профили, ленты и взаимодействия](https://proooxy.com/ru/tools/bluesky-scraper/) — Парсинг постов, профилей, лент и взаимодействий Bluesky. - [ClinicalTrials.gov Scraper — исследования, критерии участия и результаты](https://proooxy.com/ru/tools/clinical-trials-scraper/) — Поиск исследований, критериев участия и результатов ClinicalTrials.gov. - [CourtListener Scraper — судебные решения, дела и полный текст](https://proooxy.com/ru/tools/courtlistener-scraper/) — Судебная практика США, дела и полный текст решений для юридического ИИ. - [SEC EDGAR Scraper — отчетность, полнотекстовый поиск и финансовые данные XBRL](https://proooxy.com/ru/tools/sec-edgar-scraper/) — Отчетность SEC, текст 10-K/10-Q и финансовые данные XBRL — готово к RAG. - [USAspending.gov Scraper — федеральные контракты, получатели и агрегированные данные](https://proooxy.com/ru/tools/usaspending-scraper/) — Федеральные контракты, получатели и агрегированные расходы из USAspending.gov. - [YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/ru/tools/youtube-transcript-scraper/) — Транскрипты YouTube в форматах JSON, SRT, VTT или текст, готовый для LLM. - [Sephora Scraper (Глобально)](https://proooxy.com/ru/tools/sephora-scraper/) — Парсинг любой витрины Sephora — 21 рынок, один актор. - [Boohoo Scraper — данные о товарах в 7 регионах](https://proooxy.com/ru/tools/boohoo-scraper/) — Парсинг данных о товарах Boohoo в 7 региональных магазинах. - [Farfetch Scraper — данные о товарах люксовой моды](https://proooxy.com/ru/tools/farfetch-scraper/) — Парсинг товаров люксовой моды с Farfetch с поддержкой нескольких валют. - [Global API Load Tester — стресс-тест на 10K+ RPS](https://proooxy.com/ru/tools/load-tester/) — Симуляция 10K+ RPS с геораспределенным нагрузочным тестированием. - [Lululemon Scraper — товары, варианты и цены](https://proooxy.com/ru/tools/lululemon-scraper/) — Извлечение данных о товарах, вариантах и медиа Lululemon. - [Schema Markup Scraper & SEO Auditor](https://proooxy.com/ru/tools/schema-markup-scraper/) — Извлечение структурированных данных и SEO-аудит для любого сайта. - [Sephora EU Scraper — 9 европейских рынков](https://proooxy.com/ru/tools/sephora-eu-scraper/) — Извлечение данных о товарах Sephora на 9 европейских рынках. - [Shopify Scraper — данные о товарах любого магазина](https://proooxy.com/ru/tools/shopify-scraper/) — Извлечение данных о товарах из любого магазина Shopify. - [Ulta Beauty Scraper — товары, цены и SKU](https://proooxy.com/ru/tools/ulta-scraper/) — Парсинг полных данных о товарах Ulta Beauty. - [Universal Web Printer — URL и HTML в PDF и изображения](https://proooxy.com/ru/tools/web-printer/) — Конвертация URL и HTML в PDF, PNG, JPEG или WebP. --- # Macy's Scraper — товары, цены, SKU и новости - **URL:** https://proooxy.com/ru/tools/macys-scraper/ - **Тип:** tools - **Описание:** Извлекайте данные о товарах Macy's — цены, варианты, штрихкоды SKU/UPC, изображения, рейтинги и отзывы — а также новости Macy's Inc. из URL поиска, категорий, трендов и товаров. Без браузера, устойчиво к Akamai. - **Сводка:** Товары, цены, SKU/UPC и новости Macy's — устойчиво к Akamai, без браузера. - **Категория:** ecommerce - **Технологический стек:** TypeScript, Crawlee, Cheerio - **Рынки / регионы:** США - **Листинг на Apify:** https://apify.com/autofacts/macy-s-scraper - **Ключевые слова:** парсер macys, данные товаров macy's, мониторинг цен macys, парсер универмагов, данные sku upc macys, парсер отзывов macys, данные товаров ритейла - **Опубликовано:** 2026-07-15 - **Изменено:** 2026-07-15 **Ключевые возможности:** - Четыре поверхности в одном акторе — поиск товаров, категории, тренды и новости Macy's Inc. - Обходит Akamai Bot Manager без браузера, используя собственные JSON API мобильного приложения и сайта Macy's - Штрихкоды UPC для каждого SKU с цветом, размером, наличием и ценой для каждого доступного к покупке варианта - Цены в виде целых чисел в центах плюс локализованные форматированные строки — без ошибок округления чисел с плавающей запятой - Полная аналитика отзывов — гистограмма звезд, число рекомендаций и вторичные рейтинги посадки/размера - Все оттенки и размеры сгруппированы в одной записи товара, а не в отдельной строке на каждый вариант - Только чистые канонические URL — внутренние эндпоинты API и клиентские ключи никогда не попадают в вывод - Единая нормализованная схема для результатов search, category, trending и product-detail **Сценарии использования:** - Мониторинг цен и акций универмага на уровне SKU - Конкурентный анализ — цены Macy's против Nordstrom, Ulta или DTC-брендов - Сопоставление каталогов между ритейлерами по штрихкодам UPC каждого варианта - Аналитика отзывов и рейтингов для брендов, продающихся в Macy's - Мониторинг новостей ритейла — пресс-релизы Macy's Inc. и объявления о финансовых результатах **Входные параметры:** - `scrapeType` (string, обязательно) — Поверхность для парсинга: search, category, trending, news или all (по умолчанию: search). - `query` (string, опционально) — Ключевое слово для поиска товаров, например women shoes. - `startUrls` (array, опционально) — URL товаров/категорий Macy's или новостей Macy's Inc. - `categoryIds` (array, опционально) — ID категорий Macy's (например, 5449). Если известны URL категорий, предпочтительнее использовать их. - `trendingUrls` (array, опционально) — URL страниц трендов, бестселлеров или кураторских подборок. - `newsUrls` (array, опционально) — URL списка новостей или отдельных статей Macy's Inc. - `includeProductDetails` (boolean, опционально) — Обогащать элементы списка полной информацией о товаре — варианты, SKU, галереи (по умолчанию: true). - `maxPages` (number, опционально) — Максимальная глубина пагинации на каждый источник списка/новостей. - `maxResults` (number, опционально) — Лимит на количество записей в выводе. 0 = без лимита. - `proxy` (object, обязательно) — Apify Proxy или собственные URL прокси. Рекомендуются резидентные прокси со страной US. **Частые вопросы:** **Q: Как он обходит Akamai без браузера?** Он вообще не борется с JS-челленджем. Списки товаров приходят из API мобильного приложения Macy's, а детали товара — из JSON API сайта; оба работают на отдельной инфраструктуре, которая отвечает на анонимные запросы на чтение. Без логина, без cookie, без API-ключа. **Q: Цены указаны в долларах или центах?** В целых центах (5999 = $59.99), чтобы избежать ошибок округления чисел с плавающей запятой, плюс локализованные форматированные строки ($59.99) рядом. **Q: Как обрабатываются варианты и UPC?** Все цвета и размеры сгруппированы в единой записи товара с массивом variants[]. У каждого варианта свой штрихкод UPC, цвет, размер, наличие и цена — они восстановлены из данных о связях SKU Macy's, а не спарсены с виджета выбора цвета. **Q: Можно ли спарсить товары и новости за один запуск?** Да. Установите scrapeType в all и передайте любую комбинацию query, startUrls, categoryIds, trendingUrls и newsUrls. ## Пример вывода ```json { "type": "product", "source": { "id": "12345678", "canonicalUrl": "https://www.macys.com/shop/product/calvin-klein-womens-sheath-dress?ID=12345678", "retailer": "macys", "currency": "USD" }, "title": "Women's Sleeveless Sheath Dress", "brand": "Calvin Klein", "categories": ["Women", "Dresses", "Work Dresses"], "price": { "sale": 5999, "list": 9800, "currentFormatted": "$59.99", "stockStatus": "InStock" }, "stats": { "rating": 4.6, "reviewCount": 9, "ratingPercentage": 92 }, "options": [ { "type": "Color", "values": [{ "id": "1", "name": "Black" }] }, { "type": "Size", "values": [{ "id": "10", "name": "M" }, { "id": "12", "name": "L" }] } ], "variants": [ { "id": "987654", "sku": "192837465012", "options": ["Black", "M"], "price": { "stockStatus": "InStock" }, "extraInfo": { "upc": "192837465012" } } ], "medias": [{ "type": "Image", "url": "https://slimages.macysassets.com/is/image/MCY/products/.../main.jpg" }] } ``` ## Цена Оплата за событие — вы платите только за фактически сохраненные элементы: | Событие | Цена | Что включено | |---|---|---| | Спарсен товар | $0.006 | Один товар с полной информацией — варианты, SKU/UPC, цены, изображения, рейтинги | | Спарсена статья | $0.002 | Одна новостная статья Macy's Inc. — заголовок, автор, дата, текст, изображения | Скидки за объем применяются автоматически на более высоких тарифах Apify (до $0.0045 за товар). Обход 1000 товаров стоит ~$6.00 по прайс-листу. ## Советы - **Используйте резидентные прокси из США.** Эндпоинт деталей товара периодически ограничивает частоту запросов; ротация резидентных сессий проходит чисто, тогда как IP дата-центров чаще получают 403. - **Держите параллелизм умеренным.** Оптимальное значение `maxConcurrency` — 2–3; более высокие значения увеличивают число попаданий в лимит частоты запросов, не повышая пропускную способность. - **Предпочитайте URL категорий голым ID.** URL содержит путь категории, который ожидает API; голый ID может привести к более широкому или пустому набору результатов. - **Отключайте `includeProductDetails`** для быстрого прохода на уровне списка (название, бренд, цена в списке, изображение, рейтинг), когда варианты или описания не нужны. --- # Bluesky Scraper — посты, профили, ленты и взаимодействия - **URL:** https://proooxy.com/ru/tools/bluesky-scraper/ - **Тип:** tools - **Описание:** Извлекайте посты, профили, подписчиков, ленты, треды, лайкнувших и репостнувших пользователей Bluesky через AT Protocol — плюс авторизованный поиск и результаты по хэштегам с app-паролем. Чистый нормализованный JSON. - **Сводка:** Парсинг постов, профилей, лент и взаимодействий Bluesky. - **Категория:** social - **Технологический стек:** TypeScript, AT Protocol - **Рынки / регионы:** Глобально - **Листинг на Apify:** https://apify.com/autofacts/bluesky-scraper - **Ключевые слова:** парсер bluesky, bluesky api данные, данные at protocol, парсинг постов bluesky, данные профилей bluesky, парсер хэштегов bluesky, извлечение данных соцсетей - **Опубликовано:** 2026-07-01 - **Изменено:** 2026-07-01 **Ключевые возможности:** - Одиннадцать режимов — search, profile, posts, followers, following, feed, thread, likers, reposters, actorLikes и hashtag - Публичный API без учетных данных для profiles, posts, followers, following, feeds, threads, likers и reposters - Режимы с авторизацией по app-паролю — search, hashtag и лайки собственного аккаунта (actorLikes) - Экспорт вовлеченности поста — полные списки лайкнувших (likers) и сделавших репост (reposters) для каждого поста - Разворачивание треда — обходит дерево ответов на настраиваемую глубину - Автоматическая курсорная пагинация на каждом списочном эндпоинте до достижения лимита элементов - Единая нормализованная структура JSON для постов и профилей во всех режимах - Отказоустойчивый HTTP — троттлинг запросов, экспоненциальная задержка и повтор при 429/5xx **Сценарии использования:** - Мониторинг бренда и ключевых слов через авторизованный поиск - Отслеживание хэштегов и трендов по всей сети - Экспорт аудитории — списки подписчиков и подписок автора или бренда - Анализ вовлеченности — кто именно лайкнул или сделал репост конкретного поста - Построение датасетов для BI, аналитики или RAG-конвейеров на основе чистого нормализованного JSON - Архивирование обсуждений и тредов под постом **Входные параметры:** - `mode` (string, опционально) — Что парсить: posts, profile, followers, following, feed, thread, likers, reposters, actorLikes, search или hashtag (по умолчанию: posts). - `handles` (array, опционально) — Хэндлы Bluesky для режимов profile/posts/followers/following/actorLikes, например bsky.app. - `query` (string, опционально) — Текст поиска (режим search) или хэштег (режим hashtag — автоматически добавляется префикс #). - `postUri` (string, опционально) — AT URI поста — используется режимами thread, likers и reposters. - `feedUri` (string, опционально) — AT URI пользовательской ленты — используется режимом feed. - `identifier` (string, опционально) — Логин-хэндл или email Bluesky для авторизованных режимов (search, hashtag, actorLikes). - `appPassword` (string, опционально) — App-пароль Bluesky (не основной пароль аккаунта) для авторизованных режимов. - `maxItems` (number, опционально) — Максимум сохраняемых постов/профилей; каждый — одно тарифицируемое событие (по умолчанию: 100). **Частые вопросы:** **Q: Нужны ли мне учетные данные Bluesky?** Только для режимов search, hashtag и actorLikes — создайте app-пароль в настройках Bluesky и передайте его в appPassword. Режимы profile, posts, followers, following, feed, thread, likers и reposters работают без учетных данных через публичный API AT Protocol. **Q: Можно ли экспортировать лайки любого аккаунта?** Нет. API Bluesky раскрывает actorLikes только для самого авторизованного аккаунта, поэтому хэндл и логин-идентификатор должны относиться к одному и тому же аккаунту. **Q: Как найти URI поста или ленты?** AT URI выглядит так: at://did:plc:.../app.bsky.feed.post/... — скопируйте его из вывода API Bluesky или инструментов для разработчиков. URI лент используют коллекцию app.bsky.feed.generator. **Q: Безопасно ли использовать app-пароль?** Да — используйте app-пароль Bluesky (создается в Settings → App Passwords), никогда не основной пароль. Он ограничен по правам, отзываем и передается как секретный параметр. ## Пример вывода ```json { "itemType": "post", "mode": "posts", "uri": "at://did:plc:.../app.bsky.feed.post/...", "author": { "did": "did:plc:...", "handle": "bsky.app", "displayName": "Bluesky", "followersCount": 1234567 }, "text": "Example post text", "createdAt": "2026-06-11T00:00:00Z", "replyCount": 10, "repostCount": 20, "likeCount": 100, "langs": ["en"], "url": "https://bsky.app/profile/bsky.app/post/..." } ``` ## Цена Оплата за событие: **$0.001 за элемент** (пост или профиль) сохраненных данных. Экспорт 1000 элементов — это ~$1.00, а `maxItems` ограничивает и объем, и стоимость. ## Советы - **Начните с публичных режимов.** Profiles, posts, followers и вовлеченность (likers/reposters) не требуют входа — авторизацию по app-паролю оставьте для запусков search и hashtag. - **Экспортируйте не только посты, но и вовлеченность.** Режимы likers и reposters показывают, кто именно усилил охват поста, — сигнал, который пропускает большинство парсеров Bluesky. - **Ограничивайте `maxItems`** при выгрузке follower/following для крупных аккаунтов, чтобы запуски оставались быстрыми, а расходы — предсказуемыми. --- # ClinicalTrials.gov Scraper — исследования, критерии участия и результаты - **URL:** https://proooxy.com/ru/tools/clinical-trials-scraper/ - **Тип:** tools - **Описание:** Ищите в официальном API ClinicalTrials.gov v2 по состоянию, вмешательству, спонсору, локации, статусу или NCT ID. Экспортируйте нормализованные записи исследований с критериями участия, метаданными результатов и инкрементальными обновлениями — без API-ключа. - **Сводка:** Поиск исследований, критериев участия и результатов ClinicalTrials.gov. - **Категория:** public-data - **Технологический стек:** TypeScript, REST API - **Рынки / регионы:** Глобально - **Листинг на Apify:** https://apify.com/autofacts/clinical-trials-scraper - **Ключевые слова:** clinicaltrials.gov api, данные клинических исследований, датасет клинических испытаний, данные о наборе пациентов, данные критериев участия в исследованиях, мониторинг фармацевтических разработок, клинические исследования для RAG - **Опубликовано:** 2026-07-01 - **Изменено:** 2026-07-01 **Ключевые возможности:** - Официальный API ClinicalTrials.gov v2 — без API-ключа - Многопольный поиск — состояние, вмешательство, спонсор, локация и произвольный текстовый запрос - Фильтрация по статусу набора (9 значений, объединяются через OR) и фазе (Early Phase 1 → Phase 4) - Прямой поиск по NCT ID для одного или нескольких конкретных исследований - Инкрементальный мониторинг через updatedSince — возвращает только исследования, измененные начиная с указанной даты - Краткий или полный вывод — режим full добавляет сырые секции protocol, derived и results - Разбиение на абзацы, готовое к RAG, — из заголовков, описаний, критериев участия и исходов - Сигналы о результатах — hasResults, а также флаги participant-flow, outcome-measures и adverse-events - Производные термины MeSH и нормализованные данные о спонсорах, соисполнителях и локациях **Сценарии использования:** - Мониторинг разработок фарма- и биотех-компаний по спонсору или состоянию - Исследования для CRO и оценки реализуемости площадок — набирающие испытания по локации, фазе и состоянию - Конкурентная аналитика по новым и недавно обновленным исследованиям - Исследования набора пациентов по активно набирающим испытаниям - Систематические обзоры — критерии участия, исходы и метаданные результатов в промышленном масштабе - Медицинские базы знаний для ИИ / RAG, построенные из разбитого на чанки текста испытаний **Входные параметры:** - `condition` (string, опционально) — Состояние или заболевание для поиска, например diabetes. - `status` (array, опционально) — Фильтр по статусу набора, объединяется через OR, например RECRUITING, COMPLETED. - `phase` (array, опционально) — Фазы исследования — Not Applicable, Early Phase 1, Phase 1–4. - `nctIds` (array, опционально) — Получить конкретные исследования по NCT ID ClinicalTrials.gov. - `updatedSince` (string, опционально) — YYYY-MM-DD — вернуть исследования с LastUpdatePostDate на эту дату или позже. - `outputFields` (string, опционально) — summary (по умолчанию, нормализованный) или full (добавляет сырые секции protocol/derived/results). - `chunking` (string, опционально) — Разбиение текста для RAG: paragraph (по умолчанию) или none. - `maxItems` (number, опционально) — Максимум сохраняемых исследований; каждое — одно тарифицируемое событие (по умолчанию: 10). **Частые вопросы:** **Q: Нужен ли мне API-ключ?** Нет. API v2 ClinicalTrials.gov полностью публичный — актор отправляет только описательный User-Agent, без аутентификации. **Q: Можно ли получить сырые данные исследования, а не только нормализованные поля?** Да. Установите outputFields в значение 'full', чтобы получить сырые protocolSection, derivedSection и resultsSection вместе с нормализованными полями summary. **Q: Как отслеживать недавно измененные исследования?** Установите updatedSince в формате YYYY-MM-DD. Актор фильтрует по LastUpdatePostDate ClinicalTrials.gov и возвращает только исследования, обновленные в этот день или позже, — идеально для ежедневного мониторинга разработок. **Q: Охват глобальный или только по США?** Глобальный. ClinicalTrials.gov регистрирует испытания по всему миру, и массив locations каждого исследования включает страну, штат, город и учреждение, если они указаны. ## Пример вывода ```json { "itemType": "study", "nctId": "NCT01884792", "title": "Example Diabetes Study", "officialTitle": "A Study of Example Diabetes Study", "status": "COMPLETED", "phase": ["PHASE2"], "studyType": "INTERVENTIONAL", "conditions": ["Diabetes Mellitus"], "sponsors": { "lead": "Example Sponsor Inc.", "collaborators": [] }, "locations": [ { "facility": "Example Medical Center", "city": "Boston", "state": "MA", "country": "United States", "status": "COMPLETED" } ], "hasResults": true, "resultsSummary": { "hasParticipantFlow": true, "hasOutcomeMeasures": true, "hasAdverseEvents": true }, "lastUpdate": "2026-06-01", "url": "https://clinicaltrials.gov/study/NCT01884792" } ``` ## Цена Оплата за событие: **$0.002 за исследование** сохраненных данных, независимо от режима вывода summary или full. Экспорт 1000 исследований — это ~$2.00, а `maxItems` ограничивает и объем, и стоимость. ## Советы - **Используйте `updatedSince` для мониторинга изменений.** Запланируйте ежедневный запуск со вчерашней датой, чтобы отслеживать только новые или измененные испытания, — это самый дешевый способ следить за разработками конкурентов. - **Комбинируйте `condition` + `status: [RECRUITING]` + `phase`**, чтобы построить точечный список для оценки реализуемости, не выгружая весь реестр. - **Указывайте `outputFields: full`** только когда вам нужны сырые секции — нормализованный summary уже включает критерии участия, спонсоров, локации и флаги результатов. --- # CourtListener Scraper — судебные решения, дела и полный текст - **URL:** https://proooxy.com/ru/tools/courtlistener-scraper/ - **Тип:** tools - **Описание:** Запрашивайте в CourtListener судебные решения США, дела RECAP, устные слушания, судей и цитаты — с полным текстом решений и чанками, готовыми к RAG. Фильтрация по суду, дате или ключевому слову. - **Сводка:** Судебная практика США, дела и полный текст решений для юридического ИИ. - **Категория:** public-data - **Технологический стек:** TypeScript, Cheerio - **Рынки / регионы:** США - **Листинг на Apify:** https://apify.com/autofacts/courtlistener-scraper - **Ключевые слова:** courtlistener api, данные судебной практики, парсер судебных решений, данные дел recap, данные для юридических исследований, датасет судебной практики сша, судебная практика для RAG - **Опубликовано:** 2026-07-01 - **Изменено:** 2026-07-01 **Ключевые возможности:** - Шесть типов поиска в одном акторе — opinions, dockets (RECAP), RECAP documents, oral arguments, judges и citation lookup - Полный текст решений — переходит от результатов поиска к базе данных за полными текстами, а не фрагментами по 300 символов - Чанкинг, готовый к RAG, — абзацы по ~2000 символов, каждый с порядковым индексом - Разрешение цитат — сопоставляет до 250 строк цитат (например, 576 U.S. 644) с найденными делами - Булев полнотекстовый поиск плюс фильтры по ID суда, диапазону дат подачи и порядку сортировки - Темп запросов с учетом лимитов и точной задержкой при 429 по всем форматам ответов CourtListener - Потоковая курсорная пагинация до заданного лимита элементов - Используйте свой токен или встроенный ротируемый пул токенов **Сценарии использования:** - Юридические исследования — выгрузка полнотекстовой судебной практики по суду, диапазону дат или ключевому слову - Аналитика судебных процессов — отслеживание активности по делам суда по теме и дате - Юридический ИИ / RAG — построение корпуса судебной практики, разбитого на чанки и готового для эмбеддингов - Анализ цитирования — сопоставление цитат из процессуального документа со связанными делами и числом цитирований - Эмпирические юридические исследования — судьи, метаданные устных слушаний и тренды в решениях - Юридическая журналистика — мониторинг новых решений или дел в конкретных судах **Входные параметры:** - `searchType` (string, опционально) — Что получить: opinions, dockets, recap_docs, oral_arguments, judges или citation (по умолчанию: opinions). - `query` (string, опционально) — Полнотекстовый запрос с булевыми операторами — обязателен, если не используется фильтр по суду или поиск по цитате. - `citations` (array, опционально) — Строки цитат для разрешения (до 250) — обязательно для режима citation. - `court` (string, опционально) — ID суда CourtListener, например scotus, ca9, nyed. - `dateFrom` (string, опционально) — Дата подачи не ранее (YYYY-MM-DD). - `includeFullText` (boolean, опционально) — Получать полный текст решений и чанки для RAG (по умолчанию: false). - `apiToken` (string, опционально) — Ваш API-токен CourtListener; если не указан, используется встроенный ротируемый пул. - `maxItems` (number, опционально) — Максимум сохраняемых элементов; каждый — одно тарифицируемое событие (по умолчанию: 5). **Частые вопросы:** **Q: Нужен ли мне API-токен CourtListener?** CourtListener его требует. Укажите свой бесплатный токен через apiToken или положитесь на встроенный резервный ротируемый пул актора. Собственный токен позволяет поднять пропускную способность на платном/членском тарифе. **Q: Доступен ли полный текст решения для всех типов поиска?** Нет. Полный текст и чанкинг (includeFullText) применяются только к opinions и по умолчанию отключены, чтобы запуски оставались быстрыми. Dockets, RECAP documents, oral arguments, judges и citation возвращают только метаданные. **Q: Какие суды охвачены?** Все, что индексирует CourtListener, — федеральные суды США (SCOTUS, апелляционные и окружные суды через RECAP), а также многие суды штатов, адресуемые собственными ID судов CourtListener, например scotus, ca9 или nyed. **Q: Насколько быстро он может работать?** Пропускная способность ограничена лимитом частоты запросов вашего токена (бесплатный тариф CourtListener — несколько запросов в минуту) с автоматической задержкой при 429; членский токен поднимает потолок. ## Пример вывода ```json { "itemType": "legal", "searchType": "opinions", "id": "10380001", "title": "Climate United Fund v. Citibank, N.A.", "court": "Court of Appeals for the D.C. Circuit", "date": "2025-04-16", "url": "https://www.courtlistener.com/opinion/10380001/...", "citations": [], "citeCount": 0, "docketNumber": "23-5138", "fullText": "...", "chunks": [{ "text": "...", "order": 0 }], "meta": { "courtId": "cadc", "clusterId": 10380001 } } ``` ## Цена Оплата за событие — вы платите только за сохраненные элементы: | Событие | Цена | Что включено | |---|---|---| | Решение с полным текстом | $0.005 | Одно сохраненное решение с полным текстом + чанки для RAG | | Элемент метаданных | $0.002 | Дело, устное слушание, судья, цитата или запись только с метаданными | Корпус из 1000 решений с полным текстом — это ~$5.00; `maxItems` ограничивает и объем, и стоимость. ## Советы - **Включайте `includeFullText` только для решений, которые реально пойдут в эмбеддинги.** Это требует дополнительных запросов на каждое решение и отключено по умолчанию — сначала точно отфильтруйте по суду и дате. - **Используйте режим `citation`, чтобы обогатить процессуальный документ.** Вставьте строки цитат и получите связанные записи дел и число цитирований за один запуск. - **Используйте собственный токен CourtListener** для крупных задач — низкий лимит частоты запросов бесплатного тарифа является главным узким местом по пропускной способности. --- # SEC EDGAR Scraper — отчетность, полнотекстовый поиск и финансовые данные XBRL - **URL:** https://proooxy.com/ru/tools/sec-edgar-scraper/ - **Тип:** tools - **Описание:** Извлекайте метаданные отчетности SEC EDGAR, полнотекстовые секции 10-K/10-Q, результаты полнотекстового поиска EDGAR и финансовые факты XBRL в виде чистого JSON, готового к RAG. API-ключ не требуется. - **Сводка:** Отчетность SEC, текст 10-K/10-Q и финансовые данные XBRL — готово к RAG. - **Категория:** public-data - **Технологический стек:** TypeScript, Cheerio - **Рынки / регионы:** США - **Листинг на Apify:** https://apify.com/autofacts/sec-edgar-scraper - **Ключевые слова:** sec edgar api, парсер sec edgar, данные отчетности 10-k, парсер 10-Q, финансовые данные xbrl, полнотекстовый поиск edgar, данные sec для RAG, api финансовых показателей компаний - **Опубликовано:** 2026-07-01 - **Изменено:** 2026-07-01 **Ключевые возможности:** - Четыре режима в одном акторе — метаданные отчетности, полный текст документа, полнотекстовый поиск EDGAR и финансовые факты XBRL - Чанкинг, готовый к RAG, — section, paragraph (~2000 символов) или none; каждый чанк помечен исходным Item и порядковым номером - Автоматический парсинг секций «Item N» для 10-K/10-Q (Item 1A Risk Factors, Item 7 MD&A и другие) - Факты XBRL с таксономией, тегом, меткой, единицей измерения, значением, финансовым годом/периодом, формой и номером accession - Дедупликация фактов сворачивает переформулировки XBRL в одну строку на период, сохраняя самое раннее раскрытие - Определение компании по тикеру, CIK или названию по официальному файлу тикеров SEC, с нечетким поиском как запасным вариантом - Полнотекстовый поиск EDGAR с фразами в кавычках, фильтрами по типу формы и диапазону дат (2001 → настоящее время) - Ограничение частоты запросов и User-Agent в соответствии с требованиями SEC — без API-ключа и без входа **Сценарии использования:** - RAG/LLM-конвейеры для финансов, которым нужен текст 10-K и 10-Q, разбитый на секции и готовый для эмбеддингов - Инвестиционные исследования — выгрузка временных рядов выручки, чистой прибыли и разводненной EPS в виде чистых строк XBRL - Мониторинг комплаенса и владения — Form 4, SC 13D/13G и формулировки риск-факторов по компаниям - Финтех-продукты, которым нужны структурированные данные EDGAR без разработки собственного краулера - Исследования рынка и отрасли через полнотекстовый поиск — кто и с каких пор раскрывает определенную формулировку - BI-процессы и работа с таблицами на основе чистых строк финансовых фактов XBRL **Входные параметры:** - `mode` (string, обязательно) — Режим извлечения: filings, fulltext, search или facts (по умолчанию: filings). - `ticker` (string, опционально) — Биржевой тикер, например AAPL. Во время выполнения обязателен один из параметров ticker/cik/companyName. - `cik` (string, опционально) — Central Index Key SEC, например 320193 — имеет приоритет над ticker и companyName. - `companyName` (string, опционально) — Название регистранта SEC, точное или нечеткое совпадение по официальному файлу тикеров. - `query` (string, опционально) — Выражение полнотекстового поиска EDGAR, например "supply chain disruption" — обязательно для режима search. - `formTypes` (array, опционально) — Типы форм для включения, например 10-K, 10-Q, 8-K, S-1, DEF 14A, Form 4. Пусто = все формы. - `chunking` (string, опционально) — Стратегия чанкинга для RAG: section, paragraph (~2000 символов) или none (по умолчанию: section). - `maxItems` (number, опционально) — Максимум сохраняемых элементов; каждый сохраненный элемент — одно тарифицируемое событие (по умолчанию: 100). **Частые вопросы:** **Q: Нужен ли мне API-ключ SEC?** Нет. SEC EDGAR — это бесплатные открытые данные. Актор идентифицирует себя соответствующим требованиям User-Agent и автоматически ограничивает частоту запросов в рамках лимита SEC — без ключа и без входа. **Q: На сколько лет назад доступны данные?** Полнотекстовый поиск EDGAR (EFTS) охватывает отчетность начиная с 2001-05-04 и ограничен 10 000 результатов на запрос. Метаданные отчетности доступны с 1994 года, а финансовые факты XBRL охватывают все, что компания раскрыла в формате XBRL. **Q: Готов ли вывод для LLM и RAG?** Да. В режиме fulltext актор разбирает 10-K/10-Q на секции «Item N» и выдает чанки, готовые для эмбеддингов (section или абзацы по ~2000 символов), каждый из которых помечен исходным Item и порядковым индексом. **Q: Почему некоторые отчеты пропускаются в режиме fulltext?** Отчеты, у которых основной документ не в формате HTML или TXT (например, XML Form 4 только в XBRL), нельзя разобрать на секции, поэтому они пропускаются — и не тарифицируются. ## Пример вывода ```json { "itemType": "filing-fulltext", "title": "Apple Inc. — 10-K 2025-10-31", "company": "Apple Inc.", "ticker": "AAPL", "cik": "0000320193", "formType": "10-K", "filedAt": "2025-10-31", "accessionNo": "0000320193-25-000123", "documentUrl": "https://www.sec.gov/Archives/edgar/data/320193/...", "sections": [ { "name": "Item 1A — Risk Factors", "charCount": 38241 }, { "name": "Item 7 — Management's Discussion and Analysis", "charCount": 21077 } ], "chunks": [ { "text": "The Company's business, reputation, results of operations...", "section": "Item 1A — Risk Factors", "order": 12 } ], "textLength": 220151 } ``` ## Цена Оплата за событие — вы платите только за фактически сохраненные элементы: | Событие | Цена | Что включено | |---|---|---| | Метаданные отчетности / результат поиска | $0.001 | Одна запись метаданных отчетности или результат полнотекстового поиска | | Отчетность с полным текстом | $0.005 | Один отчет, извлеченный, разобранный на секции и разбитый на чанки для RAG | | Факт XBRL | $0.0002 | Одна строка финансового факта XBRL | Выгрузка метаданных 1000 отчетов — это ~$1.00; 1000 фактов XBRL — ~$0.20. `maxItems` ограничивает и объем, и стоимость. ## Советы - **Начните с режима `facts` для финансовых показателей.** Выгрузка строк XBRL (выручка, чистая прибыль, EPS) намного дешевле и чище, чем разбор полных отчетов, если нужны только цифры. - **Используйте `chunking: section` для RAG.** Это сохраняет каждый Item (Risk Factors, MD&A) целостным, поэтому retrieval возвращает связные, пригодные для цитирования фрагменты. - **Полнотекстовый поиск охватывает период с 2001 года.** Для более старых раскрытий определите компанию по CIK и выгрузите метаданные отчетности напрямую. --- # USAspending.gov Scraper — федеральные контракты, получатели и агрегированные данные - **URL:** https://proooxy.com/ru/tools/usaspending-scraper/ - **Тип:** tools - **Описание:** Запрашивайте в официальном API USAspending.gov v2 федеральные контракты, гранты и займы. Фильтруйте по агентству, получателю, NAICS/PSC или дате и выгружайте профили получателей, итоги по категориям и геоагрегаты по штатам, округам и избирательным округам. Без API-ключа. - **Сводка:** Федеральные контракты, получатели и агрегированные расходы из USAspending.gov. - **Категория:** public-data - **Технологический стек:** TypeScript, REST API - **Рынки / регионы:** США - **Листинг на Apify:** https://apify.com/autofacts/usaspending-scraper - **Ключевые слова:** usaspending api, данные федеральных контрактов, данные государственных расходов, данные федеральных грантов, исследование рынка госконтрактов, данные федеральных контрактов и выплат, данные контрактов по naics psc - **Опубликовано:** 2026-07-01 - **Изменено:** 2026-07-01 **Ключевые возможности:** - Официальный API USAspending.gov v2 — без API-ключа - Поиск контрактов по ключевым словам, финансовому году/диапазону дат, агентству, получателю, NAICS, PSC, сумме и типу контракта - Шесть режимов — поиск контрактов, детали контракта, субконтракты, профиль получателя, итоги по категориям и география - 18 измерений агрегации по категориям (получатель, NAICS, PSC, агентство, округ, избирательный округ, CFDA, TAS и другие) - Геоагрегаты по штатам, округам, избирательным округам Конгресса и странам с полями населения и показателей на душу населения - Автоматическое разбиение по датам (по месяцам/кварталам) для больших многолетних наборов результатов - Автоматическая группировка кодов типов контрактов в допустимые группы запросов API - Точный поиск деталей контракта и субконтрактов по сгенерированному ID контракта **Сценарии использования:** - Развитие бизнеса в сфере государственных контрактов — поиск возможностей и действующих подрядчиков по NAICS, PSC или агентству - Конкурентная аналитика по истории контрактов конкурента и его связям с агентствами - Журналистские расследования, отслеживающие федеральные расходы до конкретных получателей или территорий - Политические и академические исследования трендов расходов по категориям, типам контрактов или периодам - Due diligence-проверка истории федеральных контрактов и расходов получателя - BI-дашборды с картированием федеральных расходов по штатам, округам или избирательным округам **Входные параметры:** - `mode` (string, опционально) — Рабочий режим: awards, awardDetail, subawards, recipient, byCategory или geography (по умолчанию: awards). - `keywords` (array, опционально) — Произвольные текстовые фильтры по ключевым словам USAspending для поиска контрактов. - `fiscalYear` (number, опционально) — Федеральный финансовый год (соответствует диапазону дат с 1 октября по 30 сентября). - `awardTypes` (array, опционально) — Коды типов контрактов USAspending; смешанные группы автоматически разбиваются на допустимые запросы. - `agency` (string, опционально) — Фильтр по точному названию агентства-заказчика или агентства-плательщика. - `naicsCodes` (array, опционально) — Коды NAICS, которым должен соответствовать контракт. - `awardId` (string, опционально) — Сгенерированный ID контракта — обязателен во время выполнения для режимов awardDetail и subawards. - `maxItems` (number, опционально) — Максимум сохраняемых записей; каждая строка — одно тарифицируемое событие (по умолчанию: 100). **Частые вопросы:** **Q: Нужен ли мне API-ключ?** Нет. API v2 USAspending.gov публичный и не требует ни ключа, ни входа. **Q: Почему смешанные коды типов контрактов разбиваются на несколько запросов?** USAspending отклоняет единый поисковый запрос, смешивающий коды из разных групп типов контрактов (contracts, IDVs, grants, loans, other financial assistance, direct payments). Актор автоматически группирует запрошенные коды и помечает каждую строку вывода соответствующими кодами типа контракта. **Q: Какие географические разбивки доступны?** Штат, округ, избирательный округ Конгресса и страна — с привязкой либо к месту исполнения контракта, либо к местоположению получателя, с полями населения и показателей на душу населения. **Q: Как тарифицируется запуск?** Оплата за событие — $0.001 за сохраненную строку, взимается один раз за каждую успешно возвращенную запись. maxItems ограничивает число строк и, соответственно, стоимость. ## Пример вывода ```json { "itemType": "award", "title": "HT940216C0001 — HUMANA GOVERNMENT BUSINESS INC", "date": "2016-02-01", "awardId": "HT940216C0001", "generatedId": "CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-", "recipient": { "name": "HUMANA GOVERNMENT BUSINESS INC", "uei": "...", "duns": "..." }, "awardingAgency": "Department of Defense", "fundingAgency": "Department of Defense", "amount": 51269205263.03, "awardType": "IDV_B_C", "naics": { "code": "...", "description": "..." }, "placeOfPerformance": { "stateCode": "...", "state": "..." }, "awardTypeCodes": ["IDV_B_C"], "url": "https://www.usaspending.gov/award/CONT_AWD_HT940216C0001_9700_-NONE-_-NONE-" } ``` ## Цена Оплата за событие: **$0.001 за сохраненную запись**, взимается один раз за каждую успешно возвращенную строку. Запуск на ~1000 записей — это ~$1.00, а `maxItems` ограничивает и объем, и стоимость. ## Советы - **Начинайте с кодов NAICS или PSC** для поиска возможностей в сфере госконтрактов — они напрямую соответствуют продуктам/услугам, которые вы продаете, и возвращают самый чистый набор релевантных контрактов. - **Используйте режим `byCategory`**, чтобы ранжировать топ получателей или агентств на рынке, прежде чем выгружать детали отдельных контрактов. - **Режим geography возвращает только первую страницу (до 100 строк)** на каждую комбинацию диапазона дат/типа контракта — сужайте фильтры вместо повышения `maxItems` для сводок по штатам/округам/избирательным округам. --- # YouTube Subtitle & Transcript Scraper — JSON, SRT, VTT, LLM - **URL:** https://proooxy.com/ru/tools/youtube-transcript-scraper/ - **Тип:** tools - **Описание:** Извлекайте субтитры и транскрипты YouTube из видео, Shorts, плейлистов и каналов в форматах JSON, SRT, VTT, обычный текст или чистый текст, готовый для LLM. 100+ языков, богатые метаданные, без API-ключа — а неудачные извлечения бесплатны. - **Сводка:** Транскрипты YouTube в форматах JSON, SRT, VTT или текст, готовый для LLM. - **Категория:** social - **Технологический стек:** TypeScript, InnerTube - **Рынки / регионы:** Глобально - **Листинг на Apify:** https://apify.com/autofacts/youtube-subtitle-transcript-scraper - **Ключевые слова:** парсер транскриптов youtube, youtube transcript api, скачать субтитры youtube, youtube субтитры в текст, массовая выгрузка транскриптов youtube, youtube транскрипт srt vtt, транскрипты youtube для LLM - **Опубликовано:** 2026-07-01 - **Изменено:** 2026-07-01 **Ключевые возможности:** - Один вход обрабатывает видео, Shorts, ссылки youtu.be, плейлисты и каналы — можно смешивать в одном запуске - Пять форматов вывода — JSON (с таймкодами), SRT, VTT, обычный текст и LLM-ready (убирает [Music], [Applause] и метки говорящих) - 100+ языков со списком приоритетов и переключаемым откатом на автоматические субтитры - Богатые метаданные — заголовок, канал, описание, дата публикации, число просмотров, превью, длительность и доступные языки - Пакетная обработка целых плейлистов и каналов с лимитом maxVideos и параллелизмом 1–10 - Поддержка резидентных прокси плюс опциональные cookie для снижения числа блокировок при проверке на бота - Многослойное извлечение — до девяти резервных вариантов среди клиентов InnerTube, с PO-токеном yt-dlp как последним средством - Circuit breaker и обработка ошибок на уровне каждого элемента позволяют крупным пакетам продолжать работу **Сценарии использования:** - ИИ/ML-команды, строящие датасеты для RAG или fine-tuning из устной речи в видео (вывод текста LLM-ready) - Контент-команды, превращающие транскрипты в посты блога, описания выпусков и подписи для соцсетей - SEO-маркетологи, извлекающие индексируемый текст видео для индексации и подбора ключевых слов - Редакторы и издатели, которым нужны стандартные файлы субтитров SRT/VTT - Исследователи, пакетно собирающие транскрипты по всему каналу или плейлисту - Разработчики, которым нужны структурированные субтитры с таймкодами без API-ключа YouTube **Входные параметры:** - `urls` (array, опционально) — URL YouTube или голые ID — видео, Shorts, ссылки youtu.be, плейлисты или каналы. Обязателен во время выполнения. - `outputFormat` (string, опционально) — Формат транскрипта: json, srt, vtt, text или llm (по умолчанию: json). - `languages` (array, опционально) — Предпочитаемые языки субтитров по приоритету, коды ISO 639-1 (по умолчанию: en). - `includeAutoGenerated` (boolean, опционально) — Откатываться на автоматически сгенерированные субтитры, если ручные отсутствуют (по умолчанию: true). - `maxVideos` (number, опционально) — Лимит на число обрабатываемых видео за запуск, например для плейлистов/каналов (по умолчанию: 0 = без ограничений). - `maxConcurrency` (number, опционально) — Видео, обрабатываемые параллельно, 1–10 (по умолчанию: 3). - `proxyConfiguration` (object, опционально) — Настройки прокси; по умолчанию Apify Residential, закрепленный за US. - `youtubeCookies` (string, опционально) — Опциональные cookie YouTube (заголовок Cookie или cookies.txt) для снижения числа блокировок при проверке на бота. **Частые вопросы:** **Q: Нужен ли мне API-ключ YouTube или вход в аккаунт?** Нет. Актор извлекает субтитры напрямую — без ключа YouTube Data API и без входа в аккаунт. Можно опционально передать cookie, чтобы снизить число блокировок «Sign in to confirm you're not a bot» на некоторых видео. **Q: Какие языки и типы субтитров поддерживаются?** Более 100 языков. Передайте список кодов ISO 639-1 по приоритету (по умолчанию: en); актор предпочитает субтитры, созданные вручную, и откатывается на автоматически сгенерированные, если вы не отключите includeAutoGenerated. **Q: Тарифицируются ли видео, для которых извлечение не удалось?** Нет. Тарификация — оплата за событие по факту извлечения транскрипта, взимается только после успешного сохранения транскрипта. Видео с ошибкой появляются в выводе с полем error и не тарифицируются. **Q: Можно ли получить чистый текст, готовый для LLM, для RAG?** Да. Установите outputFormat в значение 'llm', чтобы убрать пометки [Music]/[Applause] и метки говорящих — получится чистый текст, идеальный для эмбеддингов и fine-tuning. ## Пример вывода ```json { "videoId": "dQw4w9WgXcQ", "url": "https://www.youtube.com/watch?v=dQw4w9WgXcQ", "title": "Rick Astley - Never Gonna Give You Up (Official Video)", "channelName": "Rick Astley", "channelId": "UCuAXFkgsw1L7xaCfnd5JJOw", "publishDate": "2009-10-25", "viewCount": 1761003712, "availableLanguages": ["en", "de-DE", "ja", "pt-BR", "es-419"], "language": "en", "isAutoGenerated": false, "duration": 213, "wordCount": 487, "segmentCount": 61, "text": "We're no strangers to love, you know the rules and so do I...", "segments": [{ "text": "We're no strangers to love", "start": 18.64, "end": 21.88 }], "error": null } ``` ## Цена Оплата за событие: тарифицируется один раз за **успешно извлеченный транскрипт** — за неудачные видео плата никогда не взимается. Передайте целый канал или плейлист и платите только за субтитры, которые реально получите. ## Советы - **Используйте `outputFormat: llm`** для RAG и fine-tuning — это убирает неречевые пометки, чтобы ваши эмбеддинги видели чистый текст. - **Держите резидентный прокси включенным.** YouTube агрессивно блокирует IP дата-центров; актор не просто так по умолчанию использует резидентные US. - **Начинайте с `maxConcurrency` 1–3 для крупных задач** и повышайте постепенно — высокий параллелизм увеличивает риск ограничения частоты запросов при парсинге крупных каналов. --- # Sephora Scraper (Глобально) - **URL:** https://proooxy.com/ru/tools/sephora-scraper/ - **Тип:** tools - **Описание:** Актор Apify, который извлекает полные данные о товарах Sephora — варианты, цены, изображения, состав и отзывы — из 21 витрины в США, Канаде, на 9 рынках ЕС и 10 рынках Азиатско-Тихоокеанского региона по единой нормализованной схеме. - **Сводка:** Парсинг любой витрины Sephora — 21 рынок, один актор. - **Категория:** ecommerce - **Технологический стек:** Python, Crawlee, curl_cffi - **Рынки / регионы:** США, Канада, Франция, Италия, Германия, Испания, Польша, Чехия, Греция, Румыния, Португалия, Новая Зеландия, Австралия, Сингапур, Малайзия, Таиланд, Индонезия, Филиппины, Гонконг, Тайвань, Бруней - **Стратегия обхода антибот-защиты:** Обход Akamai через резидентные прокси + TLS-фингерпринтинг curl_cffi - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/sephora - **Ключевые слова:** парсер sephora, данные товаров sephora, sephora api, парсинг товаров sephora, трекер цен sephora, данные товаров красоты, извлечение данных косметики, глобальный парсер sephora - **Опубликовано:** 2026-04-18 - **Изменено:** 2026-04-18 **Ключевые возможности:** - 21 витрина в одном акторе — США, Канада, 9 рынков ЕС и 10 рынков APAC под единым SKU - Автоопределение рынка — вставьте любой URL sephora.* и диспетчер направит его в нужный модуль - Смешанные мультирыночные запуски — URL US + EU + SEA в одном списке startUrls, потоково записываются в единый датасет с меткой `market` - Корректные локализованные цены — NZD, EUR, USD, AUD и еще 17 валют, возвращаемых собственным слоем локализации Sephora - Нормализованная схема — каждый рынок выдает одну и ту же структуру `source / brand / title / options / variants / medias / stats` - Изоляция сессий по рынкам — состояние авторизации не может «перетекать» между регионами - Глобальный circuit breaker — 50 последовательных сбоев прерывают запуск, чтобы не тратить вычисления впустую на недоступную цель **Сценарии использования:** - Панрегиональная аналитика цен на рынках красоты США, ЕС и APAC - Мониторинг наличия и ассортимента товаров между рынками - Конкурентный анализ для брендов, выходящих на новые регионы Sephora - Сравнение состава между региональными рецептурами - Отслеживание отзывов и рейтингов — включая сигналы избранного (wishlist) SEA и AI-сводки тональности отзывов для US - Аудит цен по программам лояльности/членства на каждом рынке **Входные параметры:** - `startUrls` (array, обязательно) — URL товаров или категорий с любой витрины sephora.*. Рынок определяется автоматически по хосту. - `market` (string, опционально) — Опциональное переопределение рынка (us, eu-fr, eu-it, eu-de, eu-es, eu-pl, eu-cz, eu-gr, eu-ro, eu-pt, sea-nz, sea-au, sea-sg, sea-my, sea-th, sea-id, sea-ph, sea-hk, sea-tw, sea-bn). - `locale` (string, опционально) — Опциональная локаль BCP 47 (например, fr-FR, en-NZ) — переопределяет рынок по умолчанию. - `categoryIds` (array, опционально) — Только для EU. ID категорий SFCC вроде C479 — альтернатива вставке URL категорий. - `proxy` (object, опционально) — Конфигурация прокси Apify. Настоятельно рекомендуются резидентные; закрепите apifyProxyCountry за целевым рынком. - `maxConcurrency` (number, опционально) — Параллельные запросы. По умолчанию 5. US: 2-5. EU: 3. SEA: 8-16. - `maxRequestsPerCrawl` (number, опционально) — Глобальный жесткий лимит по всем рынкам. 0 = без ограничений. **Частые вопросы:** **Q: Какие витрины Sephora поддерживает этот парсер?** 21 витрину: US (sephora.com), Canada (sephora.ca), 9 рынков EU (FR, IT, DE, ES, PL, CZ, GR, RO, PT) и 10 рынков APAC (NZ, AU, SG, MY, TH, ID, PH, HK, TW, BN). Рынок определяется автоматически по хосту — при смешивании рынков менять входные параметры не нужно. **Q: Можно ли парсить несколько рынков за один запуск?** Да. Смешайте URL sephora.com, sephora.fr и sephora.nz в одном списке startUrls. Диспетчер сгруппирует их по рынкам, запустит каждый модуль параллельно с подходящей для рынка авторизацией и пометит каждый элемент датасета полем `market`. **Q: Как парсер справляется с антибот-защитой?** Он использует резидентные прокси для всех рынков и curl_cffi для TLS-фингерпринтинга уровня браузера на трафике EU и SEA, чтобы обойти Akamai. Трафик US использует HttpCrawler из Crawlee с пулом сессий, который ротируется при 403/429. **Q: Продолжат ли работать мои существующие конфигурации запуска v1.x для US?** Да. Входные параметры до версии 2.0 — startUrls, maxConcurrency, proxy, maxRequestsPerCrawl — ведут себя идентично. Единственное изменение в выводе — новое поле `market` в каждом элементе, это мягкое аддитивное изменение. **Q: Почему некоторые поля равны null в данных SEA?** API Sephora SEA не предоставляет счетчик `lovesCount`, поэтому у элементов APAC `stats.lovesCount = null`. Вместо этого у каждого варианта есть булево поле `wishlisted`. И наоборот, `sentiments` (AI-сводки отзывов) и `source.crawlUrl` доступны только для US. **Q: Нужны ли отдельные API-токены или аккаунты для каждого рынка?** Нет. Ваш существующий API-токен Apify работает без изменений. Актор сам управляет гостевыми токенами по каждому рынку внутри — учетные данные не нужны для EU/SEA, а US работает на стандартных резидентных прокси Apify. ## Поддерживаемые рынки | Регион | Код рынка | Страна | Валюта | Домен | |---|---|---|---|---| | Америка | `us` | США | USD | sephora.com | | Америка | `us` | Канада | CAD | sephora.ca | | EU | `eu-fr` | Франция | EUR | sephora.fr | | EU | `eu-it` | Италия | EUR | sephora.it | | EU | `eu-de` | Германия | EUR | sephora.de | | EU | `eu-es` | Испания | EUR | sephora.es | | EU | `eu-pl` | Польша | PLN | sephora.pl | | EU | `eu-cz` | Чехия | CZK | sephora.cz | | EU | `eu-gr` | Греция | EUR | sephora.gr | | EU | `eu-ro` | Румыния | RON | sephora.ro | | EU | `eu-pt` | Португалия | EUR | sephora.pt | | APAC | `sea-nz` | Новая Зеландия | NZD | sephora.nz | | APAC | `sea-au` | Австралия | AUD | sephora.com.au | | APAC | `sea-sg` | Сингапур | SGD | sephora.sg | | APAC | `sea-my` | Малайзия | MYR | sephora.com.my | | APAC | `sea-th` | Таиланд | THB | sephora.co.th | | APAC | `sea-id` | Индонезия | IDR | sephora.co.id | | APAC | `sea-ph` | Филиппины | PHP | sephora.ph | | APAC | `sea-hk` | Гонконг | HKD | sephora.hk | | APAC | `sea-tw` | Тайвань | TWD | sephora.tw | | APAC | `sea-bn` | Бруней | BND | sephora.bn | ## Пример вывода ```json { "market": "sea-nz", "source": { "id": 58792, "canonicalUrl": "https://www.sephora.nz/products/rare-beauty-true-to-myself-natural-matte-longwear-foundation", "retailer": "SEPHORA", "currency": "NZD" }, "brand": "Rare Beauty", "title": "True To Myself Natural Matte Longwear Foundation", "description": "

A self-priming and self-setting foundation...

", "ingredients": "Aqua/Water, Cyclopentasiloxane, Glycerin...", "currentSku": "770225", "categories": ["makeup/face/foundation"], "options": [ { "name": "shade", "id": "66488", "values": [{"value": "1 Fair Neutral", "orderable": true}] } ], "variants": [ { "id": "276343", "sku": "770225", "price": { "current": 77.0, "original": 77.0, "stockStatus": "IN_STOCK" }, "options": [{"name": "shade", "value": "1 Fair Neutral"}], "highlights": ["NEW", "Only at Sephora"], "wishlisted": null } ], "medias": [{ "url": "https://www.sephora.nz/.../foundation-shade.jpg", "type": "image" }], "stats": { "reviewCount": 971, "rating": 4.8, "lovesCount": null } } ``` ## Советы - **Закрепите страну прокси за целевым рынком.** Резидентный выход в несоответствующей стране — самый крупный источник 403 от слоя Akamai у Sephora. Установите `apifyProxyCountry` в ISO-код витрины (`US`, `FR`, `NZ` и т. д.). - **Сначала проведите smoke-тест.** Установите `maxRequestsPerCrawl=10` перед первым производственным запуском на новом рынке. - **Настраивайте параллелизм по регионам.** US: 2-5. EU: 3. SEA: 8-16. При смешанных запусках у каждого рынка свой отдельный семафор. --- # Boohoo Scraper — данные о товарах в 7 регионах - **URL:** https://proooxy.com/ru/tools/boohoo-scraper/ - **Тип:** tools - **Описание:** Извлекайте данные о товарах с сайтов Boohoo e-commerce в 7 регионах — с автоматической пагинацией, фасетной фильтрацией и поддержкой нескольких валют. - **Сводка:** Парсинг данных о товарах Boohoo в 7 региональных магазинах. - **Категория:** ecommerce - **Технологический стек:** TypeScript, Cheerio, Fingerprint Generator - **Рынки / регионы:** Нидерланды, Швеция, Великобритания, Ирландия, Франция, Австралия, США - **Стратегия обхода антибот-защиты:** Генерация фингерпринтов для обхода антибот-защиты - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/boohoo-scraper - **Ключевые слова:** парсер boohoo, данные товаров boohoo, мониторинг цен boohoo, парсер fast fashion, данные каталога одежды, мультирегиональные данные моды - **Опубликовано:** 2026-04-04 - **Изменено:** 2026-04-04 **Ключевые возможности:** - Поддержка 7 региональных магазинов — NL (EUR), SE (SEK), UK (GBP), IE (EUR), FR (EUR), AU (AUD), US (USD) - Парсинг категорий и поиска с автоматической пагинацией - Поддержка фасетных фильтров — размер, цвет, диапазон цен, стиль - Полная информация о товаре, включая варианты и статус наличия - Генерация браузерных фингерпринтов для обхода антибот-защиты - Цены в разных валютах в зависимости от регионального магазина **Сценарии использования:** - Анализ конкурентных цен в сегменте fast fashion - Сравнение цен на одни и те же товары в разных регионах - Отслеживание трендов в доступной моде - Отслеживание запасов и наличия товаров по регионам - Исследование рынка моды на европейских и глобальных рынках **Входные параметры:** - `startUrls` (array, обязательно) — URL товаров или категорий Boohoo - `maxRequestsPerCrawl` (number, опционально) — Лимит запросов (по умолчанию: 5) - `maxConcurrency` (number, опционально) — Параллельные запросы (по умолчанию: 5) - `proxy` (object, опционально) — Конфигурация прокси **Частые вопросы:** **Q: Какие региональные магазины Boohoo поддерживаются?** Нидерланды (EUR), Швеция (SEK), Великобритания (GBP), Ирландия (EUR), Франция (EUR), Австралия (AUD) и США (USD). **Q: Можно ли фильтровать товары по размеру или цвету?** Да, парсер поддерживает фасетную фильтрацию. Вы можете передать URL категорий с уже примененными фильтрами, и парсер их учтет. **Q: Как парсер обрабатывает пагинацию?** Пагинация полностью автоматическая. Передайте URL категории или поиска — парсер пройдет по всем страницам пагинации и извлечет каждый товар. ## Пример вывода ```json { "source": "https://www.boohoo.com/...", "brand": "boohoo", "title": "Oversized Hoodie", "description": "Stay cozy in this oversized hoodie...", "categories": ["Women", "Hoodies & Sweatshirts"], "price": { "current": 1500, "original": 3000, "currency": "GBP" }, "variants": [ { "sku": "BH-OH-BLK-S", "size": "S", "color": "Black", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Farfetch Scraper — данные о товарах люксовой моды - **URL:** https://proooxy.com/ru/tools/farfetch-scraper/ - **Тип:** tools - **Описание:** Извлекайте данные о товарах люксовой моды с Farfetch, включая цены в разных валютах, варианты размеров/посадки и рекомендации товаров. - **Сводка:** Парсинг товаров люксовой моды с Farfetch с поддержкой нескольких валют. - **Категория:** ecommerce - **Технологический стек:** TypeScript, Cheerio, Crawlee - **Рынки / регионы:** Глобально - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/farfetch - **Ключевые слова:** парсер farfetch, данные товаров farfetch, данные люксовой моды, парсер дизайнерской одежды, мониторинг цен farfetch, данные люксового ритейла - **Опубликовано:** 2026-04-04 - **Изменено:** 2026-04-04 **Ключевые возможности:** - Парсинг страниц категорий и карточек товара - Цены в разных валютах — автоопределение по локации прокси - Опциональное извлечение вариантов размера/посадки - До 90 рекомендованных товаров на каждый товар - Полные медиагалереи и подробные описания - Извлечение бренда, категории и дополнительной информации **Сценарии использования:** - Аналитика рынка люксовой моды - Сравнение цен на дизайнерские бренды между платформами - Анализ модных трендов и обнаружение товаров - Конкурентные цены для мультибрендовых ритейлеров - Обучающие данные для рекомендательных систем товаров **Входные параметры:** - `startUrls` (array, обязательно) — URL товаров или категорий Farfetch - `proxy` (object, опционально) — Конфигурация прокси — локация влияет на валюту - `maxRequestsPerCrawl` (number, опционально) — Лимит запросов (по умолчанию: 100) - `maxConcurrency` (number, опционально) — Параллельные запросы (по умолчанию: 5) - `withSizeFit` (boolean, опционально) — Включить данные о размере/посадке (по умолчанию: false) - `withRecommends` (boolean, опционально) — Включить рекомендации (по умолчанию: false) **Частые вопросы:** **Q: Как работают цены в разных валютах?** Farfetch показывает цены в зависимости от вашей локации. Парсер использует локацию вашего прокси, чтобы определить возвращаемую валюту. Используйте прокси из США для USD, из Великобритании для GBP и так далее. **Q: Сколько рекомендованных товаров можно извлечь?** До 90 рекомендованных товаров на каждый товар при включенном withRecommends. Это полезно для построения графов товаров и датасетов рекомендаций. ## Пример вывода ```json { "source": "https://www.farfetch.com/shopping/...", "brand": "Gucci", "title": "GG Marmont Matelasse Shoulder Bag", "description": "Crafted from matelasse leather...", "details": ["Made in Italy", "100% Calf Leather"], "categories": ["Women", "Bags", "Shoulder Bags"], "options": [ { "name": "Size", "values": ["One Size"] } ], "variants": [ { "sku": "FF-GU-001", "price": 229000, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Global API Load Tester — стресс-тест на 10K+ RPS - **URL:** https://proooxy.com/ru/tools/load-tester/ - **Тип:** tools - **Описание:** Высокопроизводительный инструмент нагрузочного тестирования, симулирующий 10 000+ запросов в секунду с геораспределенным трафиком, взвешенными целями и интерактивными HTML-отчетами. - **Сводка:** Симуляция 10K+ RPS с геораспределенным нагрузочным тестированием. - **Категория:** utility - **Технологический стек:** Go, Vegeta - **Рынки / регионы:** Глобально - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/global-api-load-tester - **Ключевые слова:** инструмент нагрузочного тестирования api, http нагрузочное тестирование, инструмент стресс-тестирования, тестирование производительности, нагрузочный тест 10k rps, геораспределенное нагрузочное тестирование, нагрузочное тестирование vegeta - **Опубликовано:** 2026-04-04 - **Изменено:** 2026-04-04 **Ключевые возможности:** - Экстремальная производительность — 10 000+ запросов в секунду - Геораспределенное тестирование из США, ЕС и Азии - Взвешенные атаки на несколько целей (например, 90% чтения / 10% записи) - Поддержка резидентных прокси для реалистичного трафика - Постоянный темп запросов для предотвращения Coordinated Omission - Интерактивные HTML-отчеты через Vegeta Plots - Подробные метрики задержки, пропускной способности и ошибок **Сценарии использования:** - Бенчмаркинг производительности API перед запуском - Планирование мощностей и расчет размера инфраструктуры - Поиск точек отказа и узких мест - Тестирование конфигураций CDN и балансировщиков нагрузки - Геораспределенное тестирование задержек - Регрессионное тестирование критичных по производительности эндпоинтов **Входные параметры:** - `targets` (array, обязательно) — Целевые эндпоинты с URL, методом, телом запроса, заголовками и весом - `rate` (number, опционально) — Запросов в секунду (по умолчанию: 50) - `duration` (number, опционально) — Длительность теста в секундах (по умолчанию: 60) - `geoDistribution` (array, опционально) — Регионы с кодами стран и весами трафика - `useStickySessions` (boolean, опционально) — Сохранять привязку сессий (по умолчанию: true) - `maxCostLimit` (number, опционально) — Потолок стоимости тестового запуска **Частые вопросы:** **Q: Как работает геораспределенное тестирование?** Вы указываете коды стран и веса трафика. Инструмент распределяет запросы между серверами прокси Apify в этих регионах, симулируя реалистичные паттерны глобального трафика. **Q: Что такое Coordinated Omission?** Это распространенная ловушка нагрузочного тестирования, когда инструмент замедляется при перегрузке цели, из-за чего результаты выглядят лучше, чем есть на самом деле. Vegeta использует постоянный темп запросов, чтобы избежать этого. **Q: Можно ли тестировать эндпоинты с авторизацией?** Да, включите заголовки авторизации в конфигурацию цели. У каждой цели могут быть свои заголовки, метод и тело запроса. ## Пример вывода Инструмент нагрузочного тестирования генерирует интерактивные HTML-отчеты и структурированные метрики: ```json { "summary": { "totalRequests": 50000, "duration": "60s", "rps": 833.33, "successRate": 99.8, "latency": { "mean": "12.4ms", "p50": "10.1ms", "p95": "28.7ms", "p99": "89.2ms", "max": "342.1ms" }, "statusCodes": { "200": 49900, "503": 100 } } } ``` --- # Lululemon Scraper — товары, варианты и цены - **URL:** https://proooxy.com/ru/tools/lululemon-scraper/ - **Тип:** tools - **Описание:** Обходите и извлекайте карточки товаров Lululemon, включая данные о вариантах, цветовые опции, медиагалереи и информацию о ценах. - **Сводка:** Извлечение данных о товарах, вариантах и медиа Lululemon. - **Категория:** ecommerce - **Технологический стек:** TypeScript, Crawlee - **Рынки / регионы:** США - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/lululemon-scraper - **Ключевые слова:** парсер lululemon, данные товаров lululemon, трекер цен lululemon, данные товаров спортивной одежды, данные цен на атлетик-одежду, парсер остатков lululemon - **Опубликовано:** 2026-04-04 - **Изменено:** 2026-04-04 **Ключевые возможности:** - Обход страниц категорий и товаров - Извлечение вариантов с опциями цвета и размера - Полные медиагалереи с изображениями по каждому цвету - Отслеживание цен со структурированным выводом - Извлечение иерархии категорий - Легкий и быстрый благодаря фреймворку Crawlee **Сценарии использования:** - Исследование рынка спортивной одежды и конкурентный анализ - Мониторинг цен для реселлеров и площадок сравнения цен - Агрегация каталога товаров для фитнес-e-commerce - Отслеживание наличия по цвету и размеру - Анализ трендов в моде на активную одежду **Входные параметры:** - `startUrls` (array, обязательно) — URL товаров или категорий Lululemon - `proxy` (object, опционально) — Конфигурация прокси - `maxConcurrency` (number, опционально) — Лимит параллельных запросов **Частые вопросы:** **Q: Обрабатывает ли парсер разные цветовые варианты?** Да, каждый цветовой вариант извлекается со своими изображениями, SKU и статусом наличия. Медиагалерея привязана к конкретному цвету. **Q: Можно ли спарсить целые категории Lululemon?** Да, укажите URL категории, и парсер обойдет все товары внутри нее. ## Пример вывода ```json { "source": "https://shop.lululemon.com/p/...", "brand": "lululemon", "title": "Align High-Rise Pant 25\"", "description": "Buttery-soft, weightless Nulu fabric...", "categories": ["Women", "Pants", "Yoga Pants"], "options": [ { "name": "Color", "values": ["Black", "True Navy", "Dark Olive"] }, { "name": "Size", "values": ["2", "4", "6", "8", "10", "12"] } ], "variants": [ { "sku": "LL-AHR-BLK-6", "name": "Black / 6", "price": 9800, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://...", "color": "Black" } ], "stats": { "rating": 4.7, "reviewCount": 15234 } } ``` --- # Schema Markup Scraper & SEO Auditor - **URL:** https://proooxy.com/ru/tools/schema-markup-scraper/ - **Тип:** tools - **Описание:** Извлекайте JSON-LD, Microdata, RDFa, Open Graph и Twitter Cards с любого URL с комплексной системой SEO-аудита и скорингом. - **Сводка:** Извлечение структурированных данных и SEO-аудит для любого сайта. - **Категория:** utility - **Технологический стек:** TypeScript, Crawlee - **Рынки / регионы:** Глобально - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/metadata-scraper - **Ключевые слова:** проверка schema разметки, экстрактор структурированных данных, экстрактор json-ld, инструмент seo аудита, проверка open graph, парсер microdata, тестирование rich results - **Опубликовано:** 2026-04-04 - **Изменено:** 2026-04-04 **Ключевые возможности:** - Извлечение структурированных данных — JSON-LD, Microdata и RDFa - Социальные мета-теги — Open Graph, Twitter Cards, Dublin Core - SEO-анализ со скорингом от 0 до 100 - Валидация канонического URL и hreflang - Извлечение автора для сигналов EEAT - Определение LocalBusiness с 80+ подтипами - Аудит alt-текста изображений - Валидация схемы хлебных крошек (Breadcrumb) - Извлечение гео-тегов и данных NAP **Сценарии использования:** - Технический SEO-аудит в промышленном масштабе - Валидация структурированных данных сайтов - Конкурентный SEO-анализ — сравнение schema-разметки конкурентов - Оценка сигналов EEAT для контентных сайтов - Аудит локального SEO для бизнеса - Проверка SEO-чеклиста перед запуском **Входные параметры:** - `startUrls` (array, обязательно) — URL для анализа - `proxy` (object, опционально) — Конфигурация прокси - `maxRequestsPerCrawl` (number, опционально) — Ограничение общего числа URL для аудита - `maxConcurrency` (number, опционально) — Параллельные запросы - `extractMetaTags` (boolean, опционально) — Извлекать мета-теги (по умолчанию: true) - `extractSeoAnalysis` (boolean, опционально) — Выполнять SEO-анализ (по умолчанию: true) - `computeSeoScore` (boolean, опционально) — Рассчитывать SEO-скор от 0 до 100 (по умолчанию: true) - `extractGeoData` (boolean, опционально) — Извлекать гео-теги и данные NAP **Частые вопросы:** **Q: Какие форматы структурированных данных поддерживаются?** JSON-LD, Microdata и RDFa. Парсер также извлекает метаданные Open Graph, Twitter Cards и Dublin Core. **Q: Как рассчитывается SEO-скор?** Скор от 0 до 100 оценивает теги title, meta-описания, иерархию заголовков, alt-текст изображений, канонические URL, мобильный viewport, наличие структурированных данных и другие факторы. **Q: Можно ли аудировать несколько страниц одновременно?** Да, передайте несколько URL в startUrls. Парсер обрабатывает их параллельно для быстрого массового аудита. ## Пример вывода ```json { "url": "https://example.com/product/...", "title": "Example Product Page", "linkedData": [ { "@type": "Product", "name": "..." } ], "openGraph": { "og:title": "Example Product", "og:type": "product" }, "twitterCard": { "card": "summary_large_image" }, "seoAudit": { "score": 78, "issues": [ "Missing alt text on 3 images", "No hreflang tags detected" ] }, "headings": { "h1": ["Example Product"], "h2": ["Description", "Reviews"] } } ``` --- # Sephora EU Scraper — 9 европейских рынков - **URL:** https://proooxy.com/ru/tools/sephora-eu-scraper/ - **Тип:** tools - **Описание:** Парсите полные данные о товарах Sephora Europe на 9 рынках ЕС с извлечением мультивариантов, обходом Akamai WAF и умным управлением токенами. - **Сводка:** Извлечение данных о товарах Sephora на 9 европейских рынках. - **Категория:** ecommerce - **Технологический стек:** TypeScript, Crawlee, Akamai Bypass - **Рынки / регионы:** Франция, Италия, Германия, Испания, Польша, Чехия, Греция, Румыния, Португалия - **Стратегия обхода антибот-защиты:** Akamai WAF — TLS-фингерпринтинг уровня браузера - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/sephora-eu-scraper - **Ключевые слова:** парсер sephora европа, данные товаров sephora eu, данные европейской индустрии красоты, парсер sephora франция, парсер sephora германия, данные европейской косметики, обход akamai waf - **Опубликовано:** 2026-04-04 - **Изменено:** 2026-04-04 **Ключевые возможности:** - Поддержка 9 рынков ЕС — FR, IT, DE, ES, PL, CZ, GR, RO, PT - Извлечение мультивариантов с индивидуальными ценами и статусом наличия - Галереи изображений высокого разрешения для каждого товара - Просмотр категорий по ID категорий для массового извлечения - TLS-фингерпринтинг уровня браузера для обхода Akamai WAF - Управление гостевыми токенами с автообновлением и экспоненциальной задержкой **Сценарии использования:** - Сравнение цен на общеевропейском рынке красоты - Мониторинг наличия товаров между рынками - Исследование выхода на рынок ЕС для бьюти-брендов - Конкурентная аналитика по европейским рынкам - Анализ региональной ценовой стратегии **Входные параметры:** - `startUrls` (array, опционально) — URL товаров Sephora EU для парсинга - `categoryIds` (array, опционально) — ID категорий для массового извлечения товаров - `locale` (string, опционально) — Локаль целевого рынка (например, fr-FR, it-IT) - `maxProducts` (number, опционально) — Максимум товаров для извлечения - `maxConcurrency` (number, опционально) — Лимит параллельных запросов - `proxyConfiguration` (object, опционально) — Настройки прокси — рекомендуются резидентные **Частые вопросы:** **Q: Какие европейские рынки Sephora поддерживаются?** Франция (fr-FR), Италия (it-IT), Германия (de-DE), Испания (es-ES), Польша (pl-PL), Чехия (cs-CZ), Греция (el-GR), Румыния (ro-RO) и Португалия (pt-PT). **Q: Как парсер обходит Akamai WAF?** Он использует TLS-фингерпринтинг уровня браузера, имитируя соединения настоящего браузера, из-за чего запросы неотличимы от трафика реальных пользователей. **Q: Можно ли спарсить целые категории?** Да, вы можете указать ID категорий, чтобы извлечь все товары внутри категории. Это самый эффективный способ массового извлечения. ## Пример вывода ```json { "source": "https://www.sephora.fr/p/...", "brand": "Rare Beauty", "title": "Soft Pinch Liquid Blush", "description": "Un blush liquide longue tenue...", "shortDescription": "Blush liquide", "categories": ["Maquillage", "Teint", "Blush"], "options": [ { "name": "Shade", "values": ["Joy", "Hope", "Grace"] } ], "variants": [ { "sku": "EU-RB-001", "name": "Joy", "price": 2800, "currency": "EUR", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ], "stats": { "rating": 4.7, "reviewCount": 3421 } } ``` --- # Shopify Scraper — данные о товарах любого магазина - **URL:** https://proooxy.com/ru/tools/shopify-scraper/ - **Тип:** tools - **Описание:** Профессиональный инструмент для извлечения точных данных о товарах из любого магазина на Shopify, включая коллекции, поиск и рекомендации товаров. - **Сводка:** Извлечение данных о товарах из любого магазина Shopify. - **Категория:** ecommerce - **Технологический стек:** TypeScript, got-scraping - **Рынки / регионы:** Глобально - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/shopify-scraper-ppe - **Ключевые слова:** парсер shopify, парсер товаров shopify, парсинг магазина shopify, данные товаров shopify, альтернатива api shopify, извлечение данных e-commerce, экспорт товаров shopify, парсер коллекций shopify - **Опубликовано:** 2026-04-04 - **Изменено:** 2026-04-04 **Ключевые возможности:** - Универсальный — работает с любым магазином на Shopify - Извлечение каталога всего магазина и поддержка поиска - Рекомендации товаров (до 20 на товар) - Парсинг коллекций и отдельных товаров - Извлечение тегов и категорий - Нормализация валюты (цены ×100) для точности **Сценарии использования:** - Исследование рынка по магазинам Shopify в любой нише - Конкурентный анализ для DTC-брендов - Агрегация каталога товаров для платформ сравнения - Отслеживание трендов среди независимых e-commerce магазинов - Построение датасетов для рекомендаций товаров - Мониторинг цен для реселлеров **Входные параметры:** - `startUrls` (array, обязательно) — URL магазина Shopify — товар, коллекция или главная страница магазина - `proxy` (object, опционально) — Для лучших результатов рекомендуется резидентный прокси - `maxRequestsPerCrawl` (number, опционально) — Лимит запросов (по умолчанию: 100) - `maxRecommendationsPerProduct` (number, опционально) — Количество рекомендуемых товаров для получения (по умолчанию: 0, максимум: 20) - `query` (string, опционально) — Поисковый запрос для поиска товаров внутри магазина **Частые вопросы:** **Q: Работает ли это с любым магазином Shopify?** Да, парсер работает с любым магазином на Shopify. Он использует стандартную структуру данных о товарах Shopify, единую для всех магазинов. **Q: Можно ли искать конкретные товары?** Да, используйте параметр query для поиска внутри конкретного магазина. Это полезно для поиска определенных типов товаров без парсинга всего каталога. **Q: Как извлекаются рекомендации товаров?** Установите maxRecommendationsPerProduct, чтобы получать похожие товары. Доступно до 20 рекомендаций на товар — полезно для построения графов товаров. ## Пример вывода ```json { "source": "https://store.example.com/products/...", "brand": "Example Brand", "title": "Premium Organic Cotton T-Shirt", "description": "Made from 100% organic cotton...", "categories": ["Tops", "T-Shirts"], "tags": ["organic", "sustainable", "cotton"], "options": [ { "name": "Size", "values": ["S", "M", "L", "XL"] }, { "name": "Color", "values": ["White", "Black", "Navy"] } ], "variants": [ { "sku": "SHOP-OCT-WHT-M", "name": "White / M", "price": 4500, "currency": "USD", "inStock": true } ], "medias": [ { "type": "image", "url": "https://..." } ] } ``` --- # Ulta Beauty Scraper — товары, цены и SKU - **URL:** https://proooxy.com/ru/tools/ulta-scraper/ - **Тип:** tools - **Описание:** Извлекайте детали товаров, цены, изображения и информацию о SKU с Ulta Beauty, включая страницы категорий, страницы брендов и разделы распродаж. - **Сводка:** Парсинг полных данных о товарах Ulta Beauty. - **Категория:** ecommerce - **Технологический стек:** TypeScript, Cheerio, Crawlee - **Рынки / регионы:** США - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/ulta-scraper - **Ключевые слова:** парсер ulta, парсер ulta beauty, данные товаров ulta, трекер цен ulta, парсер sku ulta, мониторинг распродаж ulta, данные ритейла красоты - **Опубликовано:** 2026-04-04 - **Изменено:** 2026-04-04 **Ключевые возможности:** - Поддержка страниц категорий, карточек товара, брендов и распродаж - Полные детали товара с ценами, описаниями и изображениями - Извлечение данных на уровне SKU с группировкой вариантов - Автоматическое определение типа страницы по URL - Легкий парсинг на базе Cheerio для скорости - Группирует связанные SKU в рамках одного товара **Сценарии использования:** - Конкурентный анализ в индустрии красоты — цены Ulta против Sephora - Построение каталога товаров для платформ сравнения цен - Мониторинг распродаж и акций - Обнаружение брендов и отслеживание присутствия на рынке - Мониторинг остатков на уровне SKU **Входные параметры:** - `startUrls` (array, обязательно) — URL товаров, категорий, брендов или распродаж Ulta - `proxy` (object, опционально) — Конфигурация прокси - `maxConcurrency` (number, опционально) — Максимум параллельных запросов - `maxRequestsPerCrawl` (number, опционально) — Лимит общего числа запросов за запуск **Частые вопросы:** **Q: Какие типы страниц Ulta можно парсить?** Парсер поддерживает карточки товара, страницы списков категорий, страницы брендов и страницы распродаж/акций. Тип страницы определяется автоматически по URL. **Q: Как обрабатываются варианты товара?** Варианты (разные оттенки, размеры) группируются в рамках одного родительского товара. У каждого варианта свой SKU, цена и статус наличия. ## Пример вывода ```json { "source": "https://www.ulta.com/p/...", "brand": "NYX Professional Makeup", "title": "Butter Gloss", "description": "A buttery soft and silky lip gloss...", "categories": ["Makeup", "Lips", "Lip Gloss"], "variants": [ { "sku": "ULTA-NYX-BG-001", "name": "Angel Food Cake", "price": 900, "currency": "USD", "inStock": true } ], "stats": { "rating": 4.5, "reviewCount": 8932 } } ``` --- # Universal Web Printer — URL и HTML в PDF и изображения - **URL:** https://proooxy.com/ru/tools/web-printer/ - **Тип:** tools - **Описание:** Конвертируйте любой URL или HTML в PDF, PNG, JPEG или WebP с умной склейкой скролла, извлечением элементов, шифрованием PDF и водяными знаками. - **Сводка:** Конвертация URL и HTML в PDF, PNG, JPEG или WebP. - **Категория:** utility - **Технологический стек:** TypeScript, Playwright, PDF-lib, Sharp - **Рынки / регионы:** Глобально - **Заявленная успешность:** >99% - **Листинг на Apify:** https://apify.com/autofacts/universal-web-printer - **Ключевые слова:** html в pdf api, конвертер url в pdf, api скриншотов сайтов, веб-страница в pdf, url в изображение, веб-страница в png, api генерации pdf - **Опубликовано:** 2026-04-04 - **Изменено:** 2026-04-04 **Ключевые возможности:** - Вывод в нескольких форматах — PDF, PNG, JPEG, WebP - Несколько режимов просмотра — viewport, full-page, CSS-селектор, readability - Умная склейка скролла для точных full-page снимков - Извлечение на уровне элементов через CSS-селекторы - Манипуляции со страницей — удаление элементов, клики по кнопкам, инъекция CSS, скрытие фиксированных шапок - Шифрование PDF (RC4 128-бит) и водяные знаки - Объединение PDF для многостраничных документов - Настраиваемый viewport и коэффициент масштабирования **Сценарии использования:** - Автоматическая генерация отчетов из веб-дашбордов - Архивирование и документирование сайтов - Снимки для визуального регрессионного тестирования - Скриншоты страниц товаров e-commerce для каталогов - Юридический комплаенс — фиксация веб-контента в качестве доказательств - Генерация PDF из веб-приложений **Входные параметры:** - `startUrls` (array, опционально) — URL для рендеринга - `htmlContent` (string, опционально) — Сырой HTML для рендеринга - `outputFormat` (string, опционально) — pdf, png, jpeg или webp (по умолчанию: pdf) - `viewMode` (string, опционально) — viewport, fullPage, selector или readability - `targetSelector` (string, опционально) — CSS-селектор для захвата на уровне элемента - `viewportWidth` (number, опционально) — Ширина viewport браузера (по умолчанию: 1280) - `viewportHeight` (number, опционально) — Высота viewport браузера (по умолчанию: 720) - `removeSelectors` (array, опционально) — CSS-селекторы элементов для удаления перед захватом - `pdfPassword` (string, опционально) — Шифровать PDF с использованием RC4 128-бит **Частые вопросы:** **Q: Можно ли захватить только конкретный элемент на странице?** Да, используйте параметр targetSelector с CSS-селектором, чтобы захватить только конкретный элемент. Например, используйте '#main-content', чтобы захватить только основную область контента. **Q: Как работает умная склейка скролла?** Для full-page захватов инструмент прокручивает страницу по шагам, снимая каждый срез viewport, а затем склеивает их вместе. Это гарантирует корректный захват контента с ленивой загрузкой и анимаций. **Q: Можно ли убрать баннеры cookie или рекламу перед захватом?** Да, используйте removeSelectors, чтобы указать CSS-селекторы элементов для удаления. Также можно использовать hideFixedElements, чтобы скрыть липкие шапки и плавающие элементы. ## Пример вывода Инструмент генерирует файлы в выбранном вами формате (PDF, PNG, JPEG или WebP) и сохраняет их в датасете Apify. Каждый результат включает метаданные: ```json { "url": "https://example.com", "format": "pdf", "fileName": "example-com.pdf", "fileSize": 245832, "viewMode": "fullPage", "viewport": { "width": 1280, "height": 720 }, "encrypted": false } ``` --- # Лучшие практики веб-парсинга в 2026 году: руководство практика - **URL:** https://proooxy.com/ru/blog/web-scraping-best-practices-2026/ - **Тип:** blog - **Описание:** Проверенные боем стратегии веб-парсинга на основе более чем 12 лет производственного опыта — архитектурные паттерны, обработка ошибок, управление прокси и нормализация вывода. - **Ключевые слова:** лучшие практики веб-парсинга, производственный парсинг данных, руководство по извлечению данных, архитектура парсера, обработка ошибок при парсинге сайтов, управление прокси и сессиями, нормализация данных парсинга - **Опубликовано:** 2026-04-01 - **Изменено:** 2026-04-01 После создания и поддержки 15 производственных парсеров, которыми пользуются более 3100 пользователей с успешностью >99%, вот практики, которые действительно имеют значение. ## Архитектура: мыслите конвейерами, а не скриптами Самая большая ошибка, которую я вижу, — это отношение к парсингу как к одношаговому процессу. Производственные парсеры — это конвейеры данных: 1. **Обнаружение URL** — находим, что парсить (sitemap, страницы категорий, поиск, API) 2. **Выполнение запросов** — получаем данные с корректными повторами и ротацией 3. **Парсинг** — извлекаем структурированные поля из сырых ответов 4. **Нормализация** — очищаем, валидируем и стандартизируем вывод 5. **Хранение** — отправляем в датасеты, базы данных или последующие системы Каждый шаг должен быть независимо тестируемым и повторяемым. Когда Sephora меняет верстку страницы товара, обновить нужно только шаг 3 — остальной конвейер остается стабильным. ## Всегда предпочитайте API парсингу HTML Прежде чем писать хоть один CSS-селектор, проверьте, есть ли у сайта: - **Публичные API** — документированные эндпоинты, возвращающие JSON - **Закрытые API** — XHR/fetch-вызовы, видимые в DevTools браузера - **GraphQL-эндпоинты** — встречаются все чаще, часто с включенной интроспекцией - **Встроенный JSON** — `__NEXT_DATA__`, `window.__INITIAL_STATE__` или JSON-LD внутри HTML Ответы API структурированы, версионированы и намного стабильнее верстки HTML. Мой [парсер Sephora](/ru/tools/sephora-scraper/) преобразует каждый веб-URL в вызов API — он ни разу не сломался из-за редизайна фронтенда. ## Стратегия прокси: соответствуйте уровню защиты Не каждому сайту нужны резидентные прокси. Вот моя схема принятия решений: | Уровень защиты | Тип прокси | Примеры сайтов | |-----------------|------------|---------------| | Нет / базовый | Дата-центр | Большинство магазинов на Shopify, небольшие сайты | | Ограничение частоты запросов | Ротация дата-центров | Средний e-commerce, контентные сайты | | Фингерпринтинг | Резидентные | Sephora, Farfetch, крупные бренды | | Продвинутый WAF | Резидентные + TLS-фингерпринт | Akamai, Cloudflare Enterprise | Ключевой вывод: **стоимость прокси растет вместе с уровнем защиты**. Не тратьте деньги на резидентные прокси для сайтов, которые проверяют только репутацию IP. Мой [парсер Shopify](/ru/tools/shopify-scraper/) прекрасно работает с прокси дата-центров, потому что защита Shopify по умолчанию минимальна. ## Управление сессиями — это все Разница между успешностью 60% и 99% обычно кроется в управлении сессиями: - **Ротируйте сессии, а не только IP** — новый IP со старыми cookie выглядит подозрительно - **Разогревайте сессии** — заходите на главную страницу перед страницами товаров - **Соблюдайте лимиты частоты запросов** — 5 параллельных запросов лучше, чем 50, которые заблокируют - **Экспоненциальная задержка** — повторы через 1с, 2с, 4с, 8с, а не мгновенные повторы Мой [парсер Sephora EU](/ru/tools/sephora-eu-scraper/) управляет гостевыми токенами с автоматическим обновлением и экспоненциальной задержкой. Он поддерживает устойчивые сессии, похожие на паттерны реального просмотра. ## Нормализуйте вывод Сырые спарсенные данные грязные. Нормализуйте все: ### Цены Храните как целые числа (центы, а не доллары). `$29.99` превращается в `2999`. Это избавляет от ошибок точности чисел с плавающей запятой, которые портят финансовые данные ниже по конвейеру. Этой конвенции следует каждый мой парсер для e-commerce. ### URL Всегда храните абсолютные URL, никогда — относительные пути. Разрешайте их в момент извлечения. ### Даты ISO 8601 (`2026-04-01T00:00:00Z`), всегда с часовым поясом. Никогда не храните даты в локализованном формате. ### Текст Убирайте лишние пробелы, нормализуйте Unicode и определитесь с политикой обработки HTML (удалять теги или сохранять форматирование). ## Обработка ошибок: ожидайте сбоев Производственные парсеры падают постоянно — вопрос лишь в том, насколько плавно. Мой подход: ``` Request fails (network error, timeout, 4xx/5xx) → Retry with exponential backoff (up to 5 attempts) → Rotate session/proxy on retry → Log failure with full context if all retries exhausted → Continue processing remaining URLs (don't crash the batch) ``` Отслеживайте успешность по паттернам URL. Если успешность страниц `/category/*` внезапно падает ниже 90%, сайт, вероятно, что-то изменил — вы заметите это раньше, чем сообщат пользователи. ## Мониторинг и оповещения Парсер без мониторинга — это парсер, который рано или поздно молча сломается. Отслеживайте: - **Успешность** по каждому запуску и паттерну URL - **Количество записей на выходе** — резкое падение значит, что что-то сломалось - **Качество данных** — пустые поля, неожиданные значения, нарушения схемы - **Стоимость** — использование прокси, время вычислений, хранилище Все мои акторы Apify предоставляют эти метрики. Когда успешность падает, я получаю уведомление в течение часов — часто раньше, чем это заметит хоть один пользователь. ## Начинайте просто, усложняйте по необходимости Каждый парсер, который я создаю, начинается с самого простого решения, которое работает: 1. Сначала **HTTP + Cheerio** (быстрее и дешевле всего) 2. **Добавляем фингерпринтинг**, только если блокируют 3. **Добавляем рендеринг в браузере**, только если требуется JavaScript 4. **Добавляем ротацию прокси**, только при ограничении частоты запросов Мой [парсер Ulta](/ru/tools/ulta-scraper/) — это чистый Cheerio, без браузера. Мой [Universal Web Printer](/ru/tools/web-printer/) использует Playwright, потому что должен рендерить JavaScript. Правильный инструмент для конкретной задачи. --- Это не теоретические принципы — они выведены из работы производственных парсеров, обрабатывающих миллионы запросов. Если вам нужен парсер на заказ, построенный по этим практикам, — [давайте обсудим](/ru/contact/). --- # Понимание антибот-защиты: что работает в 2026 году - **URL:** https://proooxy.com/ru/blog/bypassing-anti-bot-protection-guide/ - **Тип:** blog - **Описание:** Технический разбор современных антибот-систем — Cloudflare, Akamai, Datadome — и легитимных техник обхода, используемых в производственном парсинге. - **Ключевые слова:** обход антибот-защиты, обход cloudflare, обход akamai, обход datadome, детекция ботов, защита от парсинга сайтов - **Опубликовано:** 2026-03-15 - **Изменено:** 2026-03-15 Антибот-защита — это гонка вооружений. Как человек, который каждый день создает производственные парсеры, обходящие эти системы, я хочу дать взгляд практика на этот ландшафт — что именно проверяют системы защиты и как выглядят легитимные техники обхода. ## Уровни детекции Современные антибот-системы работают послойно. Понимание этих уровней — ключ к надежному обходу: ### Уровень 1: репутация IP Самая простая проверка. Антибот-сервисы ведут базы данных известных диапазонов IP дата-центров, выходных узлов VPN и ранее помеченных IP-адресов. **Что проверяется:** - Принадлежит ли этот IP AWS, GCP, Azure или известному хостинг-провайдеру? - Помечался ли этот IP ранее за активность ботов? - Сколько запросов недавно поступило с этого IP? **Контрмера:** резидентные прокси от таких сервисов, как Apify Proxy или Bright Data, предоставляют IP-адреса, принадлежащие реальным интернет-провайдерам, что делает их неотличимыми от обычных пользователей на уровне IP. ### Уровень 2: TLS-фингерпринтинг Вот тут становится интересно. У каждого HTTP-клиента есть уникальная сигнатура TLS-рукопожатия, основанная на: - поддерживаемых наборах шифров и их порядке - расширениях TLS и их порядке - поддерживаемых версиях TLS - протоколах ALPN У стандартной библиотеки `axios` или `requests` TLS-фингерпринт буквально кричит «бот», потому что не соответствует ни одному реальному браузеру. Такие сервисы, как Akamai и Cloudflare, ведут базы фингерпринтов для каждой версии браузера. **Контрмера:** библиотеки вроде `got-scraping` (ее использует мой [парсер Shopify](/ru/tools/shopify-scraper/)) и специализированные TLS-клиенты умеют имитировать TLS-фингерпринты уровня браузера. Мой [парсер Sephora EU](/ru/tools/sephora-eu-scraper/) использует TLS-фингерпринтинг уровня браузера для обхода Akamai WAF. ### Уровень 3: HTTP/2-фингерпринтинг Помимо TLS, тип клиента выдают настройки HTTP/2: - параметры фрейма SETTINGS (размер таблицы заголовков, максимум одновременных потоков) - значения фрейма WINDOW_UPDATE - структура дерева приоритетов - паттерны сжатия заголовков (HPACK) У каждого браузера свои характерные настройки HTTP/2. Chrome, Firefox и Safari выглядят по-разному на этом уровне. ### Уровень 4: JavaScript-челленджи Страница Cloudflare «checking your browser» и подобные челленджи выполняют JavaScript, который: - проверяет наличие браузерных API (canvas, WebGL, AudioContext) - измеряет тайминги выполнения - проверяет свойства DOM - отправляет ответы на челлендж обратно на сервер **Контрмера:** headless-браузеры (Playwright, Puppeteer) выполняют эти челленджи нативно. Главное — убедиться, что headless-браузер не «протекает» сигналами автоматизации (подробнее об этом ниже). ### Уровень 5: поведенческий анализ Самый сложный уровень. Эти системы анализируют: - паттерны движения мыши (слишком линейные = бот) - поведение прокрутки (мгновенный скролл в конец страницы = бот) - время между действиями (слишком стабильное = бот) - паттерны навигации (прямой переход на страницы товаров без просмотра каталога = подозрительно) - частоту запросов (идеально равномерные интервалы = бот) ## Профили защиты: с чем вы имеете дело ### Cloudflare **Часто встречается на:** небольших и средних сайтах, блогах, API Cloudflare предлагает несколько уровней защиты: - **Basic** — репутация IP + ограничение частоты запросов. Обычно достаточно прокси дата-центров с соблюдением лимитов. - **Managed Challenge** — JavaScript-челлендж + turnstile. Нужен браузер или решатель челленджей. - **Enterprise/Bot Management** — полный поведенческий анализ + фингерпринтинг. Нужны резидентные прокси и качественный фингерпринтинг. ### Akamai Bot Manager **Часто встречается на:** крупных e-commerce платформах (Sephora EU, крупные ритейлеры) Akamai — одна из самых сложных систем для обхода из-за: - агрессивного TLS-фингерпринтинга - сбора сенсорных данных через клиентский JavaScript - поведенческого анализа на уровне сессии - проверки целостности cookie Мой подход к Akamai: TLS-фингерпринтинг уровня браузера + управление гостевыми токенами + темп запросов, имитирующий поведение человека. ### Datadome **Часто встречается на:** e-commerce, продаже билетов Datadome фокусируется на: - фингерпринтинге устройств через JavaScript - CAPTCHA-челленджах для подозрительного трафика - поведенческом скоринге в реальном времени ### PerimeterX (ныне HUMAN) **Часто встречается на:** ритейле, финансовых сервисах Известен агрессивными JavaScript-челленджами и поведенческим анализом. ## Архитектура легитимного обхода Для производственных систем, которым нужно надежное непрерывное извлечение данных, вот архитектурный паттерн, который я использую: ### 1. Подход API-first Прежде чем пытаться обойти защиту, проверьте, нет ли API-пути, который полностью минует WAF. Многие системы защиты применяются только к эндпоинтам, обращенным к браузеру, а не к API-маршрутам. Мой [парсер Sephora](/ru/tools/sephora-scraper/) преобразует каждый веб-URL в вызов API. У API-эндпоинтов защита слабее, чем у сайта, потому что они рассчитаны на мобильные приложения. ### 2. Разогрев сессии Не переходите сразу на страницу с данными. Постройте реалистичную сессию просмотра: ``` Visit homepage → Browse categories → View product listing → Access product detail ``` Каждый шаг повышает доверие к сессии. Антибот-система видит паттерн, соответствующий поведению настоящего пользователя. ### 3. Согласованность фингерпринта Это критично: ваш фингерпринт должен быть **внутренне согласованным**. Если TLS сообщает «Chrome 120», а User-Agent — «Chrome 118», это сигнал для детекции. Приведите в соответствие: - TLS-фингерпринт - настройки HTTP/2 - заголовок User-Agent - Accept-Language и другие заголовки - свойства браузера в JavaScript (при использовании headless) ### 4. Темп запросов Реальные люди не делают запросы строго с интервалом в 1 секунду. Добавьте реалистичную вариативность: - базовая задержка между запросами (2–5 секунд) - случайный джиттер (±30%) - более долгие паузы после событий навигации - периодические «простои» ### 5. Плавная деградация Когда вы столкнулись с челленджем или блокировкой: 1. Не повторяйте запрос сразу — это подтверждает поведение бота 2. Увеличивайте задержку экспоненциально 3. Переключитесь на свежую сессию (новый IP + новые cookie) 4. Попробуйте другой регион прокси 5. Если блокировка не проходит, переключитесь на подход с браузером ## Что больше не работает - **Просто смена User-Agent** — системы детекции проверяют десятки сигналов, а не один заголовок - **Только случайные задержки** — без правильного фингерпринтинга тайминги не помогают - **Headless Chrome с настройками по умолчанию** — сигналы автоматизации «протекают» повсюду (`navigator.webdriver`, отсутствующие плагины, артефакты Chrome DevTools Protocol) - **Повторное использование cookie** — современные системы привязывают cookie к TLS-фингерпринтам и диапазонам IP ## Этические аспекты Обход антибот-защиты — это инструмент. Как и любой инструмент, его можно использовать ответственно или безответственно. **Легитимные сценарии использования:** - сравнение цен в интересах потребителей - исследование рынка на основе открытых данных - доступность (предоставление данных в структурированных форматах) - академические исследования - контроль качества и мониторинг **Всегда соблюдайте:** - директивы robots.txt - лимиты частоты запросов (даже если их можно превысить — не делайте этого) - регулирование персональных данных (GDPR, CCPA) - условия использования сервиса (изучите правовое поле в вашей юрисдикции) Все мои [инструменты](/ru/tools/) созданы для легитимного извлечения данных со встроенным ограничением частоты запросов и лучшими практиками работы с прокси. --- Понимание антибот-систем делает вас лучшим инженером по парсингу. Если вам нужны производственные парсеры, надежно справляющиеся с этими вызовами, посмотрите мои [инструменты](/ru/tools/) или [свяжитесь со мной](/ru/contact/) для индивидуальной разработки. --- # Контакты - **URL:** https://proooxy.com/ru/contact/ - **Тип:** page - **Описание:** Закажите парсер на заказ или RAG-конвейер данных — реверс-инжиниринг закрытых API, обход антибот-защиты и чистый структурированный JSON прямо в ваш ИИ-стек. - **Ключевые слова:** нанять разработчика парсеров, разработка парсера на заказ, услуги веб-парсинга, RAG-конвейер данных, услуги извлечения данных, консультант по веб-парсингу - **Опубликовано:** 0001-01-01 - **Изменено:** 0001-01-01 ## Данные, которых нет в каталоге Я разрабатываю парсеры на заказ и RAG-конвейеры данных — для ИИ-команд, дата-платформ и всех, кому открытый веб нужен в виде чистого структурированного JSON. Разовая выгрузка или непрерывно обновляемый фид — помогу в любом случае. ### Что я делаю - **Парсеры на заказ** — созданы под конкретные целевые сайты, с обходом антибот-защиты «из коробки» - **RAG-конвейеры данных** — извлечение, нормализация, чанкинг и доставка JSON, готового для retrieval, в ваше векторное хранилище или дата-склад - **Реверс-инжиниринг закрытых API** — превращаю недокументированные мобильные/веб-эндпоинты в стабильные структурированные источники - **Поддержка парсеров** — сохраняю работоспособность существующих экстракторов при изменениях на целевых сайтах - **Техническое консультирование** — обзор архитектуры вашего стека парсинга и приема данных ### Как это работает 1. **Опишите данные** — источник, нужные поля и формат доставки 2. **Бесплатная оценка реализуемости** — бесплатно оцениваю сложность цели и уровень антибот-защиты 3. **Предложение и сроки** — четкий объем работ, фиксированная цена, дата сдачи 4. **Разработка и сдача** — производственный экстрактор с документацией и чистым выводом данных ### Начать разработку
### Или свяжитесь со мной напрямую - **Email**: [p8p9cmk96@mozmail.com](mailto:p8p9cmk96@mozmail.com) - **GitHub**: [@autofacts](https://github.com/autofacts) - **Apify**: [apify.com/autofacts](https://apify.com/autofacts) --- # Обо мне - **URL:** https://proooxy.com/ru/about/ - **Тип:** page - **Описание:** Ричард Фэн — инженер по веб-парсингу с опытом более 12 лет. Я превращаю защищенные сайты в чистые структурированные данные, готовые к RAG, для ИИ-агентов, retrieval-конвейеров и LLM. - **Ключевые слова:** инженер по веб-парсингу, консультант по извлечению данных, разработка парсера на заказ, эксперт по обходу антибот-защиты, консультант по RAG-конвейерам данных, реверс-инжиниринг API - **Опубликовано:** 0001-01-01 - **Изменено:** 0001-01-01 ## Кто я Я Ричард Фэн, независимый инженер по веб-автоматизации с опытом программирования более 12 лет. Я специализируюсь на **веб-парсинге, извлечении данных и реверс-инжиниринге API** — превращаю сложные защищенные сайты в чистые структурированные данные, которые ИИ-системы могут реально использовать. Мой инструментарий охватывает **Node.js (TypeScript), Python, Go и Java**, с глубокой экспертизой в **Crawlee, Playwright и Cheerio**. Я создавал производственные системы, обрабатывающие миллионы запросов с успешностью **>99%**. ## Чем я занимаюсь Я создаю и поддерживаю **16 производственных акторов Apify**, которыми пользуются более **3100 пользователей**, со стабильной успешностью запусков **>99%**. Каждый актор выдает чистый **JSON, готовый к RAG**, — с единой схемой, без дублей, готовый к загрузке в векторное хранилище, retrieval-конвейер или обучающий датасет. Большинству акторов с открытыми данными API-ключ не нужен. Моя работа охватывает четыре направления: ### Данные e-commerce и розничной торговли Парсеры для крупных платформ в сфере красоты и моды: [Sephora](/ru/tools/sephora-scraper/) (21 витрина по всему миру), [Ulta Beauty](/ru/tools/ulta-scraper/), [Farfetch](/ru/tools/farfetch-scraper/), [Lululemon](/ru/tools/lululemon-scraper/), [Boohoo](/ru/tools/boohoo-scraper/), [Macy's](/ru/tools/macys-scraper/), а также универсальный [парсер Shopify](/ru/tools/shopify-scraper/), который работает с любым магазином на Shopify. ### Открытые, финансовые и юридические данные Официальные датасеты США в виде чистого JSON, готового к RAG, — [отчетность SEC EDGAR и финансовые показатели XBRL](/ru/tools/sec-edgar-scraper/), [федеральные контракты USAspending.gov](/ru/tools/usaspending-scraper/), [судебные решения CourtListener](/ru/tools/courtlistener-scraper/) и [исследования ClinicalTrials.gov](/ru/tools/clinical-trials-scraper/). ### Аналитика соцсетей и медиа Посты, профили и взаимодействия [Bluesky](/ru/tools/bluesky-scraper/) через AT Protocol, а также [парсер субтитров и транскриптов YouTube](/ru/tools/youtube-transcript-scraper/), который выдает JSON, SRT, VTT или текст, готовый для LLM, на 100+ языках. ### Утилиты для разработчиков Инструменты, выходящие за рамки парсинга, — [аудит SEO и структурированных данных](/ru/tools/schema-markup-scraper/), [рендеринг веб-страниц в PDF/изображения](/ru/tools/web-printer/) и [высокопроизводительное нагрузочное тестирование](/ru/tools/load-tester/). ## Специализация - **Реверс-инжиниринг закрытых API** — превращаю недокументированные мобильные/веб-эндпоинты в надежные источники данных - **Обход антибот-защиты** — Cloudflare, DataDome, Akamai WAF и другие индивидуальные системы защиты - **Вывод, готовый к RAG** — нормализованный JSON с единой схемой, созданный для retrieval и обоснования ответов - **Мультирегиональный парсинг** — локали, валюты и соответствие требованиям под контролем - **Высоконадежные системы** — экстракторы, которые держат успешность >99% при масштабировании ## Технологический стек | Категория | Технологии | |----------|-------------| | Языки | TypeScript, Python, Go, Java | | Парсинг | Crawlee, Playwright, Cheerio, Parsel, got-scraping | | Антибот | Генераторы фингерпринтов, TLS-фингерпринтинг, ротация сессий | | Инфраструктура | Apify Platform, Docker, GitHub Actions | | Тестирование | Vegeta, собственные фреймворки для нагрузочного тестирования | ## Сотрудничество Я предлагаю индивидуальные решения для парсинга, разработку RAG-конвейеров данных и постоянные услуги по извлечению данных. Если вашему ИИ нужен реальный веб в виде чистых данных — [давайте обсудим](/ru/contact/). ---