~/about

Обо мне

Ричард Фэн — инженер по веб-парсингу с опытом более 12 лет. Я превращаю защищенные сайты в чистые структурированные данные, готовые к RAG, для ИИ-агентов, retrieval-конвейеров и LLM.

Кто я

Я Ричард Фэн, независимый инженер по веб-автоматизации с опытом программирования более 12 лет. Я специализируюсь на веб-парсинге, извлечении данных и реверс-инжиниринге API — превращаю сложные защищенные сайты в чистые структурированные данные, которые ИИ-системы могут реально использовать.

Мой инструментарий охватывает Node.js (TypeScript), Python, Go и Java, с глубокой экспертизой в Crawlee, Playwright и Cheerio. Я создавал производственные системы, обрабатывающие миллионы запросов с успешностью >99%.

Чем я занимаюсь

Я создаю и поддерживаю 16 производственных акторов Apify, которыми пользуются более 3100 пользователей, со стабильной успешностью запусков >99%. Каждый актор выдает чистый JSON, готовый к RAG, — с единой схемой, без дублей, готовый к загрузке в векторное хранилище, retrieval-конвейер или обучающий датасет. Большинству акторов с открытыми данными API-ключ не нужен. Моя работа охватывает четыре направления:

Данные e-commerce и розничной торговли

Парсеры для крупных платформ в сфере красоты и моды: Sephora (21 витрина по всему миру), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, а также универсальный парсер Shopify, который работает с любым магазином на Shopify.

Открытые, финансовые и юридические данные

Официальные датасеты США в виде чистого JSON, готового к RAG, — отчетность SEC EDGAR и финансовые показатели XBRL, федеральные контракты USAspending.gov, судебные решения CourtListener и исследования ClinicalTrials.gov.

Аналитика соцсетей и медиа

Посты, профили и взаимодействия Bluesky через AT Protocol, а также парсер субтитров и транскриптов YouTube, который выдает JSON, SRT, VTT или текст, готовый для LLM, на 100+ языках.

Утилиты для разработчиков

Инструменты, выходящие за рамки парсинга, — аудит SEO и структурированных данных, рендеринг веб-страниц в PDF/изображения и высокопроизводительное нагрузочное тестирование.

Специализация

  • Реверс-инжиниринг закрытых API — превращаю недокументированные мобильные/веб-эндпоинты в надежные источники данных
  • Обход антибот-защиты — Cloudflare, DataDome, Akamai WAF и другие индивидуальные системы защиты
  • Вывод, готовый к RAG — нормализованный JSON с единой схемой, созданный для retrieval и обоснования ответов
  • Мультирегиональный парсинг — локали, валюты и соответствие требованиям под контролем
  • Высоконадежные системы — экстракторы, которые держат успешность >99% при масштабировании

Технологический стек

КатегорияТехнологии
ЯзыкиTypeScript, Python, Go, Java
ПарсингCrawlee, Playwright, Cheerio, Parsel, got-scraping
АнтиботГенераторы фингерпринтов, TLS-фингерпринтинг, ротация сессий
ИнфраструктураApify Platform, Docker, GitHub Actions
ТестированиеVegeta, собственные фреймворки для нагрузочного тестирования

Сотрудничество

Я предлагаю индивидуальные решения для парсинга, разработку RAG-конвейеров данных и постоянные услуги по извлечению данных. Если вашему ИИ нужен реальный веб в виде чистых данных — давайте обсудим.