Обо мне
Ричард Фэн — инженер по веб-парсингу. Я превращаю защищенные сайты в чистые структурированные данные, готовые к RAG, для ИИ-агентов, retrieval-конвейеров и LLM.
Кто я
Я Ричард Фэн, независимый инженер по веб-автоматизации. Я специализируюсь на веб-парсинге, извлечении данных и реверс-инжиниринге API — превращаю сложные защищенные сайты в чистые структурированные данные, которые ИИ-системы могут реально использовать.
Мой инструментарий охватывает Node.js (TypeScript), Python, Go и Java, с глубокой экспертизой в Crawlee, Playwright и Cheerio.
Чем я занимаюсь
Я создаю и поддерживаю производственные акторы Apify из этого каталога. Каждый актор выдает чистый JSON, готовый к RAG, — с единой схемой, без дублей, готовый к загрузке в векторное хранилище, retrieval-конвейер или обучающий датасет. Большинству акторов с открытыми данными API-ключ не нужен. Моя работа охватывает пять направлений:
Данные e-commerce и розничной торговли
Парсеры для крупных платформ в сфере красоты, моды и розничной торговли: Sephora (витрины в США, Канаде, ЕС, на Ближнем Востоке, в Великобритании, Индии и Азиатско-Тихоокеанском регионе), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s и Talabat Mart, а также универсальные парсеры для любого магазина на Shopify или WooCommerce.
Открытые, финансовые и юридические данные
Официальные датасеты США в виде чистого JSON, готового к RAG, — отчетность SEC EDGAR и финансовые показатели XBRL, федеральные контракты USAspending.gov, судебные решения CourtListener и исследования ClinicalTrials.gov.
Данные о компаниях, вакансиях и лидах
Вакансии Indeed и данные о работодателях, лиды Shopify-магазинов, вся реклама конкурента в Google и точки виртуальных почтовых ящиков (CMRA).
Аналитика соцсетей и медиа
Посты, профили и взаимодействия Bluesky через AT Protocol, а также парсер субтитров и транскриптов YouTube, который выдает JSON, SRT, VTT или текст, готовый для LLM, на 100+ языках, и парсер транскриптов TikTok.
Утилиты для разработчиков
Инструменты, выходящие за рамки парсинга, — аудит SEO и структурированных данных и рендеринг веб-страниц в PDF/изображения.
Специализация
- Реверс-инжиниринг закрытых API — превращаю недокументированные мобильные/веб-эндпоинты в надежные источники данных
- Обход антибот-защиты — Cloudflare, Akamai WAF и другие индивидуальные системы защиты
- Вывод, готовый к RAG — нормализованный JSON с единой схемой, созданный для retrieval и обоснования ответов
- Мультирегиональный парсинг — локали, валюты и соответствие требованиям под контролем
- Высоконадежные системы — экстракторы, созданные для бесперебойной работы без присмотра при масштабировании
Технологический стек
| Категория | Технологии |
|---|---|
| Языки | TypeScript, Python, Go, Java |
| Парсинг | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| Антибот | Генераторы фингерпринтов, TLS-фингерпринтинг, ротация сессий |
| Инфраструктура | Apify Platform, Docker, GitHub Actions |
| Тестирование | Vegeta, собственные фреймворки для нагрузочного тестирования |
Сотрудничество
Я предлагаю индивидуальные решения для парсинга, разработку RAG-конвейеров данных и постоянные услуги по извлечению данных. Если вашему ИИ нужен реальный веб в виде чистых данных — давайте обсудим.