~/about

소개

Richard Feng — 12년 이상의 경력을 가진 웹 크롤링 엔지니어입니다. 보호된 웹사이트를 AI 에이전트, 리트리벌 파이프라인, LLM을 위한 클린 RAG-레디 구조화된 데이터로 바꿉니다.

소개

저는 Richard Feng, 12년 이상의 코딩 경력을 가진 프리랜서 웹 자동화 엔지니어입니다. 웹 크롤링, 데이터 추출, API 리버스 엔지니어링을 전문으로 하며, 복잡하고 보호된 웹사이트를 AI 시스템이 실제로 활용할 수 있는 클린한 구조화 데이터로 바꿉니다.

제 툴킷은 Node.js (TypeScript), Python, Go, Java를 아우르며, Crawlee, Playwright, Cheerio에 대한 깊은 전문성을 갖추고 있습니다. 수백만 건의 요청을 >99% 성공률로 처리하는 프로덕션 시스템을 구축해왔습니다.

하는 일

3,100명 이상의 사용자에게 지속적으로 >99%의 실행 성공률을 제공하는 16개의 프로덕션급 Apify 액터를 만들고 유지보수하고 있습니다. 모든 액터는 클린한 RAG-레디 JSON을 출력합니다 — 스키마가 일관되고, 중복이 제거되어, 벡터 스토어·리트리벌 파이프라인·학습 세트에 바로 투입할 수 있습니다. 대부분의 공개 데이터 액터는 API 키가 필요 없습니다. 제 작업은 크게 네 가지 영역으로 나뉩니다:

이커머스 및 리테일 데이터

Sephora(글로벌 21개 스토어), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s 등 주요 뷰티·패션 플랫폼용 스크래퍼와, Shopify 기반이라면 어떤 스토어에도 동작하는 범용 Shopify 스크래퍼를 제공합니다.

공공·금융·법률 데이터

미국 공식 데이터셋을 클린한 RAG-레디 JSON으로 제공합니다 — SEC EDGAR 공시 및 XBRL 재무 데이터, USAspending.gov 연방 지출 내역, CourtListener 판례, ClinicalTrials.gov 임상시험.

소셜 및 미디어 인텔리전스

AT Protocol을 통한 Bluesky 게시물·프로필·인터랙션 데이터, 그리고 100개 이상의 언어로 JSON, SRT, VTT, LLM-레디 텍스트를 출력하는 YouTube 자막·스크립트 스크래퍼를 제공합니다.

개발자 유틸리티

크롤링을 넘어선 도구들입니다 — SEO 및 구조화 데이터 감사, 웹-투-PDF/이미지 렌더링, 고성능 부하 테스트.

전문 분야

  • 비공개 API 리버스 엔지니어링 — 문서화되지 않은 모바일/웹 엔드포인트를 안정적인 데이터 소스로 전환
  • 안티봇 우회 — Cloudflare, DataDome, Akamai WAF 및 커스텀 방어 시스템
  • RAG-레디 출력 — 리트리벌과 그라운딩을 위해 설계된 정규화·스키마 일관 JSON
  • 다중 지역 크롤링 — 로케일, 통화, 컴플라이언스까지 처리
  • 고신뢰성 시스템 — 대규모에서도 >99% 성공률을 유지하는 추출기

기술 스택

분류기술
언어TypeScript, Python, Go, Java
크롤링Crawlee, Playwright, Cheerio, Parsel, got-scraping
안티봇핑거프린트 생성기, TLS 핑거프린팅, 세션 로테이션
인프라Apify Platform, Docker, GitHub Actions
테스트Vegeta, 커스텀 부하 테스트 프레임워크

함께 일하기

맞춤 크롤링 솔루션, RAG 데이터 파이프라인 엔지니어링, 지속적인 데이터 추출 서비스를 제공합니다. AI에 실제 웹 데이터를 클린한 형태로 공급해야 한다면 — 이야기해봅시다.