소개
Richard Feng — 웹 크롤링 엔지니어입니다. 보호된 웹사이트를 AI 에이전트, 리트리벌 파이프라인, LLM을 위한 클린 RAG-레디 구조화된 데이터로 바꿉니다.
소개
저는 Richard Feng, 프리랜서 웹 자동화 엔지니어입니다. 웹 크롤링, 데이터 추출, API 리버스 엔지니어링을 전문으로 하며, 복잡하고 보호된 웹사이트를 AI 시스템이 실제로 활용할 수 있는 클린한 구조화 데이터로 바꿉니다.
제 툴킷은 Node.js (TypeScript), Python, Go, Java를 아우르며, Crawlee, Playwright, Cheerio에 대한 깊은 전문성을 갖추고 있습니다.
하는 일
이 카탈로그에 있는 프로덕션급 Apify 액터를 만들고 유지보수하고 있습니다. 모든 액터는 클린한 RAG-레디 JSON을 출력합니다 — 스키마가 일관되고, 중복이 제거되어, 벡터 스토어·리트리벌 파이프라인·학습 세트에 바로 투입할 수 있습니다. 대부분의 공개 데이터 액터는 API 키가 필요 없습니다. 제 작업은 크게 다섯 가지 영역으로 나뉩니다:
이커머스 및 리테일 데이터
Sephora(미국, 캐나다, EU, 중동, 영국, 인도, 아시아태평양 스토어), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, Talabat Mart 등 주요 뷰티·패션·리테일 플랫폼용 스크래퍼와, Shopify 또는 WooCommerce 기반이라면 어떤 스토어에도 동작하는 범용 스크래퍼를 제공합니다.
공공·금융·법률 데이터
미국 공식 데이터셋을 클린한 RAG-레디 JSON으로 제공합니다 — SEC EDGAR 공시 및 XBRL 재무 데이터, USAspending.gov 연방 지출 내역, CourtListener 판례, ClinicalTrials.gov 임상시험.
기업·채용·리드 데이터
Indeed 채용 공고 및 고용주 데이터, Shopify 스토어 리드, 경쟁사가 게재하는 모든 Google 광고, 가상 사서함(CMRA) 지점.
소셜 및 미디어 인텔리전스
AT Protocol을 통한 Bluesky 게시물·프로필·인터랙션 데이터, 100개 이상의 언어로 JSON, SRT, VTT, LLM-레디 텍스트를 출력하는 YouTube 자막·스크립트 스크래퍼, 그리고 TikTok 스크립트 스크래퍼를 제공합니다.
개발자 유틸리티
크롤링을 넘어선 도구들입니다 — SEO 및 구조화 데이터 감사와 웹-투-PDF/이미지 렌더링.
전문 분야
- 비공개 API 리버스 엔지니어링 — 문서화되지 않은 모바일/웹 엔드포인트를 안정적인 데이터 소스로 전환
- 안티봇 우회 — Cloudflare, Akamai WAF 및 커스텀 방어 시스템
- RAG-레디 출력 — 리트리벌과 그라운딩을 위해 설계된 정규화·스키마 일관 JSON
- 다중 지역 크롤링 — 로케일, 통화, 컴플라이언스까지 처리
- 고신뢰성 시스템 — 대규모 환경에서도 무인으로 계속 작동하도록 설계된 추출기
기술 스택
| 분류 | 기술 |
|---|---|
| 언어 | TypeScript, Python, Go, Java |
| 크롤링 | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| 안티봇 | 핑거프린트 생성기, TLS 핑거프린팅, 세션 로테이션 |
| 인프라 | Apify Platform, Docker, GitHub Actions |
| 테스트 | Vegeta, 커스텀 부하 테스트 프레임워크 |
함께 일하기
맞춤 크롤링 솔루션, RAG 데이터 파이프라인 엔지니어링, 지속적인 데이터 추출 서비스를 제공합니다. AI에 실제 웹 데이터를 클린한 형태로 공급해야 한다면 — 이야기해봅시다.