소개
Richard Feng — 12년 이상의 경력을 가진 웹 크롤링 엔지니어입니다. 보호된 웹사이트를 AI 에이전트, 리트리벌 파이프라인, LLM을 위한 클린 RAG-레디 구조화된 데이터로 바꿉니다.
소개
저는 Richard Feng, 12년 이상의 코딩 경력을 가진 프리랜서 웹 자동화 엔지니어입니다. 웹 크롤링, 데이터 추출, API 리버스 엔지니어링을 전문으로 하며, 복잡하고 보호된 웹사이트를 AI 시스템이 실제로 활용할 수 있는 클린한 구조화 데이터로 바꿉니다.
제 툴킷은 Node.js (TypeScript), Python, Go, Java를 아우르며, Crawlee, Playwright, Cheerio에 대한 깊은 전문성을 갖추고 있습니다. 수백만 건의 요청을 >99% 성공률로 처리하는 프로덕션 시스템을 구축해왔습니다.
하는 일
3,100명 이상의 사용자에게 지속적으로 >99%의 실행 성공률을 제공하는 16개의 프로덕션급 Apify 액터를 만들고 유지보수하고 있습니다. 모든 액터는 클린한 RAG-레디 JSON을 출력합니다 — 스키마가 일관되고, 중복이 제거되어, 벡터 스토어·리트리벌 파이프라인·학습 세트에 바로 투입할 수 있습니다. 대부분의 공개 데이터 액터는 API 키가 필요 없습니다. 제 작업은 크게 네 가지 영역으로 나뉩니다:
이커머스 및 리테일 데이터
Sephora(글로벌 21개 스토어), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s 등 주요 뷰티·패션 플랫폼용 스크래퍼와, Shopify 기반이라면 어떤 스토어에도 동작하는 범용 Shopify 스크래퍼를 제공합니다.
공공·금융·법률 데이터
미국 공식 데이터셋을 클린한 RAG-레디 JSON으로 제공합니다 — SEC EDGAR 공시 및 XBRL 재무 데이터, USAspending.gov 연방 지출 내역, CourtListener 판례, ClinicalTrials.gov 임상시험.
소셜 및 미디어 인텔리전스
AT Protocol을 통한 Bluesky 게시물·프로필·인터랙션 데이터, 그리고 100개 이상의 언어로 JSON, SRT, VTT, LLM-레디 텍스트를 출력하는 YouTube 자막·스크립트 스크래퍼를 제공합니다.
개발자 유틸리티
크롤링을 넘어선 도구들입니다 — SEO 및 구조화 데이터 감사, 웹-투-PDF/이미지 렌더링, 고성능 부하 테스트.
전문 분야
- 비공개 API 리버스 엔지니어링 — 문서화되지 않은 모바일/웹 엔드포인트를 안정적인 데이터 소스로 전환
- 안티봇 우회 — Cloudflare, DataDome, Akamai WAF 및 커스텀 방어 시스템
- RAG-레디 출력 — 리트리벌과 그라운딩을 위해 설계된 정규화·스키마 일관 JSON
- 다중 지역 크롤링 — 로케일, 통화, 컴플라이언스까지 처리
- 고신뢰성 시스템 — 대규모에서도 >99% 성공률을 유지하는 추출기
기술 스택
| 분류 | 기술 |
|---|---|
| 언어 | TypeScript, Python, Go, Java |
| 크롤링 | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| 안티봇 | 핑거프린트 생성기, TLS 핑거프린팅, 세션 로테이션 |
| 인프라 | Apify Platform, Docker, GitHub Actions |
| 테스트 | Vegeta, 커스텀 부하 테스트 프레임워크 |
함께 일하기
맞춤 크롤링 솔루션, RAG 데이터 파이프라인 엔지니어링, 지속적인 데이터 추출 서비스를 제공합니다. AI에 실제 웹 데이터를 클린한 형태로 공급해야 한다면 — 이야기해봅시다.