Photo by Annie Spratt on Unsplash
1. 어떤 문제를 해결하나요?
스캔한 계약서, 영수증 사진, 캡처된 표, 손으로 작성된 문서. 텍스트가 있는데 복사가 안 됩니다. 일일이 타이핑하거나 별도 OCR 앱을 쓰면 시간이 오래 걸리고, Claude에게 이미지를 보여줘도 정확도가 일정하지 않습니다.
paddleocr-text-recognition 스킬은 PaddleOCR API를 통해 이미지·PDF에서 텍스트를 위치 정보와 함께 추출합니다. URL로 제공하거나 파일을 직접 첨부하면 됩니다. 인보이스·영수증·양식·표처럼 구조화된 문서에서 특히 정확도가 높습니다.
2. 이런 분들에게 추천합니다
• 계약서·인보이스·영수증을 디지털화해야 하는 운영팀
• 경쟁사 앱 스크린샷에서 텍스트를 추출해 분석해야 하는 PM·PO
• 스캔 문서·사진에서 데이터를 추출해 스프레드시트에 입력해야 하는 데이터 담당자
• 이미지 속 표·양식의 내용을 텍스트로 변환해야 하는 리서처
• 접근성 개선을 위해 이미지 속 텍스트를 인식해야 하는 개발자
3. 어떻게 사용하는 기어인가요?
이미지 URL 또는 로컬 파일 경로를 제공하면 됩니다. 스킬이 PaddleOCR API를 호출해 텍스트를 추출하고 전체 결과를 즉시 표시합니다. 결과는 JSON 파일로도 저장되어 위치 정보 등 상세 데이터를 활용할 수 있습니다. 첫 사용 시 PADDLEOCR_OCR_API_URL, PADDLEOCR_ACCESS_TOKEN 환경 변수 설정이 필요합니다.
4. 어떤 결과를 얻을 수 있나요?
• 이미지·PDF에서 완전히 추출된 텍스트 (생략 없음)
• 텍스트 위치 정보 포함 JSON 결과물 (좌표 기반 구조화 데이터)
• 인보이스·영수증·표·양식 등 구조화 문서의 정확한 텍스트 인식
• URL 기반 또는 로컬 파일 모두 지원
• 결과를 JSON 파일로 저장하여 후처리 활용 가능
5. 포함된 구성
• paddleocr-text-recognition 스킬 소스 (SKILL.md)
• OCR 호출 스크립트 (scripts/ocr_caller.py) — URL·파일 경로 모두 지원
• 연기 테스트 스크립트 (scripts/smoke_test.py) — API 연결 확인
• 출력 스키마 레퍼런스 (references/output_schema.md)
• 에러 핸들링 가이드 (인증 실패·할당량 초과·텍스트 미감지 대응)
• 환경 변수 설정 가이드 (PADDLEOCR_OCR_API_URL, PADDLEOCR_ACCESS_TOKEN)
6. 사용 AI 도구
PaddleOCR API (PaddlePaddle 오픈소스 OCR 엔진) + Claude Sonnet 4 (결과 후처리)
7. 실제 활용 예시
• "이 인보이스 사진에서 금액이랑 날짜 뽑아줘" → 위치 정보 포함 전체 텍스트 추출 후 항목별 정리
• "경쟁사 앱 스크린샷 10장에서 텍스트 다 뽑아줘" → URL 목록으로 일괄 처리, 결과 JSON 파일 저장
• "스캔한 계약서 PDF인데 텍스트로 변환해줘" → 전체 페이지 텍스트 순서대로 추출·정리
8. 출처, 원본 링크
uthor: PaddlePaddle
Repository: PaddlePaddle/PaddleOCR
Skill file: https://github.com/PaddlePaddle/PaddleOCR/tree/main/skills/paddleocr-text-recognition
이미지·PDF에서 텍스트와 위치 정보를 정확하게 추출하는 PaddleOCR 기반 고성능 텍스트 인식 스킬