Upstage가 공개한 DP-Bench 200문서 벤치마크로 상용 파서 7곳과 비교했습니다.
이 파서는 AI 보정 없는 $0 모드로 공식 eval 스크립트를 직접 실행해 측정했고,
최상위 Upstage 두 모드는 직접 결제, 실행해 확인, 나머지 상용 수치는 공식 리더보드 값입니다.
TEDS 전체 중 1위
97.28
2위 Upstage Standard(96.06)보다 +1.20p
TEDS-S 전체 중 1위
98.13
2위 Upstage Enhanced(97.62)보다 +0.51p
가격
$0
비교 8팀 중 유일한 무료
DP-Bench 전체 순위
TEDS=표 구조 재현(내용+구조), TEDS-S=표 구조(구조만), NID=텍스트, 읽기순서 정확도 — 모두 높을수록 좋음.
OmniDocBench는 전부 스캔 이미지인 1,651페이지 벤치마크입니다.
자체 GPU(로컬 오픈소스 모델, API 비용 $0)로 공식 eval을 직접 실행했고,
selective parsing이 적용돼 필요한 부분만 VLM을 타게 하는 라우팅이 적용되었습니다.
종합 리더보드 3위권
94.98
표 TEDS 93.13(2위 상당), 수식 CDM 96.39
VLM 투입 페이지
61%
표, 수식, 판독 실패 페이지만 선택 라우팅 — 나머지 39%는 파이프라인
공식 리더보드
비교 대상 수치는 공식 리더보드 값(2026-06 스냅샷).
↑는 높을수록, ↓는 낮을수록 좋음. 순위는 종합 기준.
#
모델
종합↑
텍스트↓
수식 CDM↑
표 TEDS↑
표 TEDS-S↑
순서↓
1
MinerU2.5-Pro 전문 VLM 1.2B
95.75
0.036
97.45
93.42
95.92
0.120
2
GLM-OCR 전문 VLM 0.9B
95.22
0.044
97.18
92.83
95.39
0.133
3
해당 파서
94.98
0.046
96.39
93.13
95.79
0.136
4
PaddleOCR-VL-1.5 전문 VLM 0.9B
94.93
0.038
96.89
91.67
94.37
0.130
5
PaddleOCR-VL 전문 VLM 0.9B
94.18
0.040
95.91
90.65
93.74
0.135
6
Qianfan-OCR 전문 VLM 4B
93.90
0.040
95.08
90.53
93.31
0.130
7
Youtu-Parsing 전문 VLM 2.5B
93.74
0.044
93.63
92.02
95.00
0.116
8
Ovis2.6-30B-A3B 범용 VLM 30B
93.70
0.035
95.17
89.44
92.40
0.135
9
Logics-Parsing-v2 전문 VLM 4B
93.33
0.041
95.65
88.42
91.98
0.137
10
ABot-OCR 전문 VLM 2B
93.30
0.037
94.86
88.69
91.87
0.137
11
FireRed-OCR 전문 VLM 2B
93.26
0.037
95.44
88.04
91.06
0.131
13
Gemini 3 Pro 범용 프론티어
92.91
0.064
95.99
89.15
92.96
0.165
23
GPT-5.2 범용 프론티어
86.59
0.114
88.21
82.95
87.93
0.193
25
MinerU-Pipeline 기반 엔진(검증 앵커)
86.47
0.055
83.07
81.88
88.68
0.153
기능, 교차 페이지 표 병합
페이지를 넘어가며 잘린 표를, 하나로.
한 표가 여러 페이지에 걸치면 대부분의 파서는 페이지마다 따로 끊긴 표 조각으로 남깁니다.
이 파서는 페이지를 넘어간 같은 표를 하나로 병합합니다.
원문 — 파서가 본 페이지들
불러오는 중…
병합 결과 — 단일 표
불러오는 중…
데모용 합성 문서(19페이지 요구사항 등록부, 367개 항목)를 이 파서의 무료 모드로 그대로 돌린 결과입니다.
좌측 페이지를 넘겨 보면 같은 표가 페이지마다 끊겨 있고, 우측은 그 조각들을 하나로 이은 표입니다.
같은 로직이 지금 이 데모의 free 모드에서 그대로 동작합니다.
사례, DART 재무제표 자동 추출
재무제표를 추출하고, XBRL까지.
삼성전자 2024 사업보고서 527페이지 중 재무제표 구간 12페이지를 파싱해
자산총계, 매출액 같은 항목을 추출하고, Open DART의 XBRL 공시값과 대조했습니다.
우측 항목을 클릭하면 좌측 원문에서 해당 표 영역이 강조됩니다.
원문 — 재무제표 구간
불러오는 중…
추출 항목 — XBRL 판정
불러오는 중…
사례, 파싱 결과를 바로 RAG로
답을 찾고, 원문 위치까지.
보통의 RAG는 PDF를 텍스트로 파싱한 뒤 N자마다 자릅니다.
그러면 표가 두 동강 나고, 문단이 어느 제목 아래 있었는지 사라지고,
답변이 인용은 되지만 출처가 어디인지 모르는 상태가 됩니다.
이 파서는 블록마다 원문 위치를 함께 내놓으니, 그대로 검색 단위로 쓰면
답변의 근거가 원문 페이지 어느 위치인지까지 알 수 있습니다.
아래 답변에서 밑줄 친 문장을 누르면 좌측 원문의 그 자리가 강조됩니다.
원문 — 근거가 있는 위치
불러오는 중…
질문 — 답변과 근거
불러오는 중…
위 4페이지 문서를 이 파서로 파싱한 뒤, 그 결과만으로 청킹하고 검색해 답변한 실제 결과입니다.
검색은 AI 모델 없이 규칙 기반(BM25)으로 동작하고, 답변 문장만 모델을 씁니다.
지금 이 사이트의 데모 탭 「근거 검색」에서 직접 문서를 올려 바로 써보실 수 있습니다.