<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Proooxy — веб-данные, готовые к RAG, для ИИ-агентов и LLM</title><link>https://proooxy.com/ru/</link><description>Recent content on Proooxy — веб-данные, готовые к RAG, для ИИ-агентов и LLM</description><generator>Hugo</generator><language>ru</language><lastBuildDate>Wed, 15 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://proooxy.com/ru/index.xml" rel="self" type="application/rss+xml"/><item><title>Macy's Scraper — товары, цены, SKU и новости</title><link>https://proooxy.com/ru/tools/macys-scraper/</link><pubDate>Wed, 15 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/macys-scraper/</guid><description>Товары, цены, SKU/UPC и новости Macy&amp;rsquo;s — устойчиво к Akamai, без браузера.</description></item><item><title>Bluesky Scraper — посты, профили, ленты и взаимодействия</title><link>https://proooxy.com/ru/tools/bluesky-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/bluesky-scraper/</guid><description>Парсинг постов, профилей, лент и взаимодействий Bluesky.</description></item><item><title>ClinicalTrials.gov Scraper — исследования, критерии участия и результаты</title><link>https://proooxy.com/ru/tools/clinical-trials-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/clinical-trials-scraper/</guid><description>Поиск исследований, критериев участия и результатов ClinicalTrials.gov.</description></item><item><title>CourtListener Scraper — судебные решения, дела и полный текст</title><link>https://proooxy.com/ru/tools/courtlistener-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/courtlistener-scraper/</guid><description>Судебная практика США, дела и полный текст решений для юридического ИИ.</description></item><item><title>SEC EDGAR Scraper — отчетность, полнотекстовый поиск и финансовые данные XBRL</title><link>https://proooxy.com/ru/tools/sec-edgar-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/sec-edgar-scraper/</guid><description>Отчетность SEC, текст 10-K/10-Q и финансовые данные XBRL — готово к RAG.</description></item><item><title>USAspending.gov Scraper — федеральные контракты, получатели и агрегированные данные</title><link>https://proooxy.com/ru/tools/usaspending-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/usaspending-scraper/</guid><description>Федеральные контракты, получатели и агрегированные расходы из USAspending.gov.</description></item><item><title>YouTube Subtitle &amp; Transcript Scraper — JSON, SRT, VTT, LLM</title><link>https://proooxy.com/ru/tools/youtube-transcript-scraper/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/youtube-transcript-scraper/</guid><description>Транскрипты YouTube в форматах JSON, SRT, VTT или текст, готовый для LLM.</description></item><item><title>Sephora Scraper (Глобально)</title><link>https://proooxy.com/ru/tools/sephora-scraper/</link><pubDate>Sat, 18 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/sephora-scraper/</guid><description>Парсинг любой витрины Sephora — 21 рынок, один актор.</description></item><item><title>Boohoo Scraper — данные о товарах в 7 регионах</title><link>https://proooxy.com/ru/tools/boohoo-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/boohoo-scraper/</guid><description>Парсинг данных о товарах Boohoo в 7 региональных магазинах.</description></item><item><title>Farfetch Scraper — данные о товарах люксовой моды</title><link>https://proooxy.com/ru/tools/farfetch-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/farfetch-scraper/</guid><description>Парсинг товаров люксовой моды с Farfetch с поддержкой нескольких валют.</description></item><item><title>Global API Load Tester — стресс-тест на 10K+ RPS</title><link>https://proooxy.com/ru/tools/load-tester/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/load-tester/</guid><description>Симуляция 10K+ RPS с геораспределенным нагрузочным тестированием.</description></item><item><title>Lululemon Scraper — товары, варианты и цены</title><link>https://proooxy.com/ru/tools/lululemon-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/lululemon-scraper/</guid><description>Извлечение данных о товарах, вариантах и медиа Lululemon.</description></item><item><title>Schema Markup Scraper &amp; SEO Auditor</title><link>https://proooxy.com/ru/tools/schema-markup-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/schema-markup-scraper/</guid><description>Извлечение структурированных данных и SEO-аудит для любого сайта.</description></item><item><title>Sephora EU Scraper — 9 европейских рынков</title><link>https://proooxy.com/ru/tools/sephora-eu-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/sephora-eu-scraper/</guid><description>Извлечение данных о товарах Sephora на 9 европейских рынках.</description></item><item><title>Shopify Scraper — данные о товарах любого магазина</title><link>https://proooxy.com/ru/tools/shopify-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/shopify-scraper/</guid><description>Извлечение данных о товарах из любого магазина Shopify.</description></item><item><title>Ulta Beauty Scraper — товары, цены и SKU</title><link>https://proooxy.com/ru/tools/ulta-scraper/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/ulta-scraper/</guid><description>Парсинг полных данных о товарах Ulta Beauty.</description></item><item><title>Universal Web Printer — URL и HTML в PDF и изображения</title><link>https://proooxy.com/ru/tools/web-printer/</link><pubDate>Sat, 04 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/tools/web-printer/</guid><description>Конвертация URL и HTML в PDF, PNG, JPEG или WebP.</description></item><item><title>Лучшие практики веб-парсинга в 2026 году: руководство практика</title><link>https://proooxy.com/ru/blog/web-scraping-best-practices-2026/</link><pubDate>Wed, 01 Apr 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/blog/web-scraping-best-practices-2026/</guid><description>&lt;p&gt;После создания и поддержки 15 производственных парсеров, которыми пользуются более 3100 пользователей с успешностью &amp;gt;99%, вот практики, которые действительно имеют значение.&lt;/p&gt;
&lt;h2 id="архитектура-мыслите-конвейерами-а-не-скриптами"&gt;Архитектура: мыслите конвейерами, а не скриптами&lt;/h2&gt;
&lt;p&gt;Самая большая ошибка, которую я вижу, — это отношение к парсингу как к одношаговому процессу. Производственные парсеры — это конвейеры данных:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Обнаружение URL&lt;/strong&gt; — находим, что парсить (sitemap, страницы категорий, поиск, API)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Выполнение запросов&lt;/strong&gt; — получаем данные с корректными повторами и ротацией&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Парсинг&lt;/strong&gt; — извлекаем структурированные поля из сырых ответов&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Нормализация&lt;/strong&gt; — очищаем, валидируем и стандартизируем вывод&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Хранение&lt;/strong&gt; — отправляем в датасеты, базы данных или последующие системы&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Каждый шаг должен быть независимо тестируемым и повторяемым. Когда Sephora меняет верстку страницы товара, обновить нужно только шаг 3 — остальной конвейер остается стабильным.&lt;/p&gt;</description></item><item><title>Понимание антибот-защиты: что работает в 2026 году</title><link>https://proooxy.com/ru/blog/bypassing-anti-bot-protection-guide/</link><pubDate>Sun, 15 Mar 2026 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/blog/bypassing-anti-bot-protection-guide/</guid><description>&lt;p&gt;Антибот-защита — это гонка вооружений. Как человек, который каждый день создает производственные парсеры, обходящие эти системы, я хочу дать взгляд практика на этот ландшафт — что именно проверяют системы защиты и как выглядят легитимные техники обхода.&lt;/p&gt;
&lt;h2 id="уровни-детекции"&gt;Уровни детекции&lt;/h2&gt;
&lt;p&gt;Современные антибот-системы работают послойно. Понимание этих уровней — ключ к надежному обходу:&lt;/p&gt;
&lt;h3 id="уровень-1-репутация-ip"&gt;Уровень 1: репутация IP&lt;/h3&gt;
&lt;p&gt;Самая простая проверка. Антибот-сервисы ведут базы данных известных диапазонов IP дата-центров, выходных узлов VPN и ранее помеченных IP-адресов.&lt;/p&gt;</description></item><item><title>Контакты</title><link>https://proooxy.com/ru/contact/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/contact/</guid><description>&lt;h2 id="данные-которых-нет-в-каталоге"&gt;Данные, которых нет в каталоге&lt;/h2&gt;
&lt;p&gt;Я разрабатываю парсеры на заказ и RAG-конвейеры данных — для ИИ-команд, дата-платформ и всех, кому открытый веб нужен в виде чистого структурированного JSON. Разовая выгрузка или непрерывно обновляемый фид — помогу в любом случае.&lt;/p&gt;
&lt;h3 id="что-я-делаю"&gt;Что я делаю&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Парсеры на заказ&lt;/strong&gt; — созданы под конкретные целевые сайты, с обходом антибот-защиты «из коробки»&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;RAG-конвейеры данных&lt;/strong&gt; — извлечение, нормализация, чанкинг и доставка JSON, готового для retrieval, в ваше векторное хранилище или дата-склад&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Реверс-инжиниринг закрытых API&lt;/strong&gt; — превращаю недокументированные мобильные/веб-эндпоинты в стабильные структурированные источники&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Поддержка парсеров&lt;/strong&gt; — сохраняю работоспособность существующих экстракторов при изменениях на целевых сайтах&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Техническое консультирование&lt;/strong&gt; — обзор архитектуры вашего стека парсинга и приема данных&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="как-это-работает"&gt;Как это работает&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Опишите данные&lt;/strong&gt; — источник, нужные поля и формат доставки&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Бесплатная оценка реализуемости&lt;/strong&gt; — бесплатно оцениваю сложность цели и уровень антибот-защиты&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Предложение и сроки&lt;/strong&gt; — четкий объем работ, фиксированная цена, дата сдачи&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Разработка и сдача&lt;/strong&gt; — производственный экстрактор с документацией и чистым выводом данных&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="начать-разработку"&gt;Начать разработку&lt;/h3&gt;
&lt;form action="https://api.web3forms.com/submit" method="POST" class="form contact-form"&gt;
 &lt;input type="hidden" name="access_key" value="9ed3e6ad-95b9-46d5-b3f7-3ffd428d9c3a"&gt;
 &lt;div class="field"&gt;
 &lt;label for="name"&gt;имя&lt;/label&gt;
 &lt;input type="text" name="name" id="name" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="email"&gt;email&lt;/label&gt;
 &lt;input type="email" name="email" id="email" required&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="project"&gt;тип проекта&lt;/label&gt;
 &lt;select name="project" id="project"&gt;
 &lt;option value="custom-scraper"&gt;Парсер на заказ&lt;/option&gt;
 &lt;option value="rag-pipeline"&gt;RAG-конвейер данных&lt;/option&gt;
 &lt;option value="api-reverse-engineering"&gt;Реверс-инжиниринг закрытых API&lt;/option&gt;
 &lt;option value="consulting"&gt;Техническое консультирование&lt;/option&gt;
 &lt;option value="other"&gt;Другое&lt;/option&gt;
 &lt;/select&gt;
 &lt;/div&gt;
 &lt;div class="field"&gt;
 &lt;label for="message"&gt;что вам нужно?&lt;/label&gt;
 &lt;textarea name="message" id="message" rows="5" required&gt;&lt;/textarea&gt;
 &lt;/div&gt;
 &lt;button type="submit" class="btn btn--primary btn--lg"&gt;отправить сообщение&lt;/button&gt;
&lt;/form&gt;
&lt;h3 id="или-свяжитесь-со-мной-напрямую"&gt;Или свяжитесь со мной напрямую&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Email&lt;/strong&gt;: &lt;a href="mailto:p8p9cmk96@mozmail.com"&gt;p8p9cmk96@mozmail.com&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GitHub&lt;/strong&gt;: &lt;a href="https://github.com/autofacts"&gt;@autofacts&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Apify&lt;/strong&gt;: &lt;a href="https://apify.com/autofacts"&gt;apify.com/autofacts&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Обо мне</title><link>https://proooxy.com/ru/about/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://proooxy.com/ru/about/</guid><description>&lt;h2 id="кто-я"&gt;Кто я&lt;/h2&gt;
&lt;p&gt;Я Ричард Фэн, независимый инженер по веб-автоматизации с опытом программирования более 12 лет. Я специализируюсь на &lt;strong&gt;веб-парсинге, извлечении данных и реверс-инжиниринге API&lt;/strong&gt; — превращаю сложные защищенные сайты в чистые структурированные данные, которые ИИ-системы могут реально использовать.&lt;/p&gt;
&lt;p&gt;Мой инструментарий охватывает &lt;strong&gt;Node.js (TypeScript), Python, Go и Java&lt;/strong&gt;, с глубокой экспертизой в &lt;strong&gt;Crawlee, Playwright и Cheerio&lt;/strong&gt;. Я создавал производственные системы, обрабатывающие миллионы запросов с успешностью &lt;strong&gt;&amp;gt;99%&lt;/strong&gt;.&lt;/p&gt;
&lt;h2 id="чем-я-занимаюсь"&gt;Чем я занимаюсь&lt;/h2&gt;
&lt;p&gt;Я создаю и поддерживаю &lt;strong&gt;16 производственных акторов Apify&lt;/strong&gt;, которыми пользуются более &lt;strong&gt;3100 пользователей&lt;/strong&gt;, со стабильной успешностью запусков &lt;strong&gt;&amp;gt;99%&lt;/strong&gt;. Каждый актор выдает чистый &lt;strong&gt;JSON, готовый к RAG&lt;/strong&gt;, — с единой схемой, без дублей, готовый к загрузке в векторное хранилище, retrieval-конвейер или обучающий датасет. Большинству акторов с открытыми данными API-ключ не нужен. Моя работа охватывает четыре направления:&lt;/p&gt;</description></item></channel></rss>