Обо мне
Ричард Фэн — инженер по веб-парсингу с опытом более 12 лет. Я превращаю защищенные сайты в чистые структурированные данные, готовые к RAG, для ИИ-агентов, retrieval-конвейеров и LLM.
Кто я
Я Ричард Фэн, независимый инженер по веб-автоматизации с опытом программирования более 12 лет. Я специализируюсь на веб-парсинге, извлечении данных и реверс-инжиниринге API — превращаю сложные защищенные сайты в чистые структурированные данные, которые ИИ-системы могут реально использовать.
Мой инструментарий охватывает Node.js (TypeScript), Python, Go и Java, с глубокой экспертизой в Crawlee, Playwright и Cheerio. Я создавал производственные системы, обрабатывающие миллионы запросов с успешностью >99%.
Чем я занимаюсь
Я создаю и поддерживаю 16 производственных акторов Apify, которыми пользуются более 3100 пользователей, со стабильной успешностью запусков >99%. Каждый актор выдает чистый JSON, готовый к RAG, — с единой схемой, без дублей, готовый к загрузке в векторное хранилище, retrieval-конвейер или обучающий датасет. Большинству акторов с открытыми данными API-ключ не нужен. Моя работа охватывает четыре направления:
Данные e-commerce и розничной торговли
Парсеры для крупных платформ в сфере красоты и моды: Sephora (21 витрина по всему миру), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, а также универсальный парсер Shopify, который работает с любым магазином на Shopify.
Открытые, финансовые и юридические данные
Официальные датасеты США в виде чистого JSON, готового к RAG, — отчетность SEC EDGAR и финансовые показатели XBRL, федеральные контракты USAspending.gov, судебные решения CourtListener и исследования ClinicalTrials.gov.
Аналитика соцсетей и медиа
Посты, профили и взаимодействия Bluesky через AT Protocol, а также парсер субтитров и транскриптов YouTube, который выдает JSON, SRT, VTT или текст, готовый для LLM, на 100+ языках.
Утилиты для разработчиков
Инструменты, выходящие за рамки парсинга, — аудит SEO и структурированных данных, рендеринг веб-страниц в PDF/изображения и высокопроизводительное нагрузочное тестирование.
Специализация
- Реверс-инжиниринг закрытых API — превращаю недокументированные мобильные/веб-эндпоинты в надежные источники данных
- Обход антибот-защиты — Cloudflare, DataDome, Akamai WAF и другие индивидуальные системы защиты
- Вывод, готовый к RAG — нормализованный JSON с единой схемой, созданный для retrieval и обоснования ответов
- Мультирегиональный парсинг — локали, валюты и соответствие требованиям под контролем
- Высоконадежные системы — экстракторы, которые держат успешность >99% при масштабировании
Технологический стек
| Категория | Технологии |
|---|---|
| Языки | TypeScript, Python, Go, Java |
| Парсинг | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| Антибот | Генераторы фингерпринтов, TLS-фингерпринтинг, ротация сессий |
| Инфраструктура | Apify Platform, Docker, GitHub Actions |
| Тестирование | Vegeta, собственные фреймворки для нагрузочного тестирования |
Сотрудничество
Я предлагаю индивидуальные решения для парсинга, разработку RAG-конвейеров данных и постоянные услуги по извлечению данных. Если вашему ИИ нужен реальный веб в виде чистых данных — давайте обсудим.