~/about

关于

Richard Feng——拥有 12+ 年经验的爬虫工程师。我将受保护的网站转化为面向 AI Agent、检索管道与 LLM 的干净、RAG 就绪结构化数据。

我是谁

我是 Richard Feng,一名自由职业的网页自动化工程师,拥有 12+ 年编程经验。我专注于爬虫、数据采集与 API 逆向工程——将复杂、受保护的网站转化为 AI 系统真正可用的干净结构化数据。

我的技术栈涵盖 Node.js(TypeScript)、Python、Go 和 Java,并深入掌握 Crawlee、Playwright 与 Cheerio。我构建的生产系统能够以 >99% 的成功率处理数百万级请求。

我做什么

我构建并维护 16 款生产级 Apify Actor,服务超过 3,100 位用户,运行成功率稳定保持在 >99%。每个 Actor 都输出干净的 RAG 就绪 JSON——schema 一致、去重完毕,可直接放入向量数据库、检索管道或训练集。大多数公开数据类 Actor 无需 API 密钥。我的工作涵盖四大领域:

电商与零售数据

面向主流美妆与时尚平台的爬虫,包括 Sephora(21 个全球站点)、Ulta BeautyFarfetchLululemonBoohooMacy’s,以及适用于任意 Shopify 商店的通用 Shopify 爬虫

公开、金融与法律数据

官方美国数据集,转化为干净、RAG 就绪的 JSON——SEC EDGAR 财报文件与 XBRL 财务数据USAspending.gov 联邦支出项目CourtListener 法院判决,以及 ClinicalTrials.gov 临床研究

社交与媒体情报

通过 AT Protocol 获取 Bluesky 的帖子、主页资料与互动数据,以及一款 YouTube 字幕与文字稿爬虫,可输出 JSON、SRT、VTT 或适合 LLM 使用的文本,支持 100+ 种语言。

开发者工具

爬虫之外的工具——SEO 与结构化数据审计网页转 PDF/图片渲染,以及高性能负载测试

专长

  • 私有 API 逆向工程——将未公开的移动端/网页端接口转化为可靠的数据源
  • 反爬虫绕过——Cloudflare、DataDome、Akamai WAF 及各类定制防护
  • RAG 就绪输出——为检索与事实支撑而设计的规范化、schema 一致 JSON
  • 多地区爬取——妥善处理语言区域、货币与合规问题
  • 高可靠性系统——在大规模场景下仍保持 >99% 成功率的提取工具

技术栈

类别技术
编程语言TypeScript, Python, Go, Java
爬虫Crawlee, Playwright, Cheerio, Parsel, got-scraping
反爬虫Fingerprint generators, TLS fingerprinting, session rotation
基础设施Apify Platform, Docker, GitHub Actions
测试Vegeta, custom load-testing frameworks

与我合作

我提供定制爬虫方案、RAG 数据管道工程,以及持续性数据采集服务。如果你的 AI 需要将真实网页转化为干净数据——联系我