벤치마크 점수의 의미
2026년 중반, 문서·OCR·이진 판별형 등 고전 벤치마크 상당수가 포화(saturation)됐다 — 상위 모델들이 상단(예: DocVQA 92~96%)에 뭉쳐 절대치만으로는 변별이 어렵다. 반면 MMMU-Pro·MathVision·HallusionBench처럼 아직 여유가 큰 축도 있다. 그래서 "몇 점"보다 "그 점수가 무엇을 재고, 지금도 변별력이 있는가"가 중요하다. 변별은 아래 표에서 굵게 표시한 어려운 축으로 이동했다.
| 축 | 대표 벤치마크 | 측정 | 척도 | 2026 상태 |
|---|---|---|---|---|
| 종합 추론 | MMMU / MMMU-Pro | 대학·전문가 6분야 멀티모달 추론 | 정확도 % | MMMU 포화 진행 → MMMU-Pro가 변별(같은 모델도 점수 뚝) |
| 종합 이해 | MMBench, MMStar | 20세부능력 / "비전 필수" 문항 | % | 포화. MMStar의 MG(멀티모달 게인) 낮으면 텍스트 편법 의심 |
| 수학 | MathVista → MathVision | 시각적 수학 / 경시 난도 | % | MathVista 포화, MathVision 변별(단 오염 위험) |
| 문서·OCR | DocVQA·ChartQA·OCRBench·InfoVQA | 문서/차트/장면 텍스트 | ANLS·%·1000점 | 대부분 포화(92~96%=기본값). InfoVQA·OCRBench v2 변별 |
| 환각 | POPE·HallusionBench | 없는 객체 답변 / 착시·논리 | F1·% | POPE 포화 → adversarial·Yes비율, HallusionBench 쌍정확도(qAcc)가 신호 |
| 대결형 | LMArena Vision | 사용자 블라인드 선호 | Elo | 능력이 아닌 "선호". 텍스트 1등 ≠ 비전 1등 |
| 비디오 | Video-MME·MVBench | 장·단 영상 / 시간 이해 | % | 긴 영상·자막 없을수록 급락 |
| 그라운딩·GUI | RefCOCO·ScreenSpot-Pro | bbox / UI 좌표 지목 | % | "어느 ScreenSpot인지" 필수 — Pro가 진짜 에이전트 신호 |
성능·리더보드 현황
오픈웨이트는 검증 가능한 수치로, 프런티어(상용)는 원표 접근 제약이 커 대체로 추정으로만 다룬다. 비교의 엄밀도 자체가 비대칭임을 먼저 밝힌다.
오픈웨이트 타임라인 (MMMU val 기준, 최신순)
| 모델 | 공개 | 파라미터 | MMMU | MathVision | 근거 |
|---|---|---|---|---|---|
| GLM-4.6V | 2025-12 | 106B·A12B MoE (+9B Flash) | SOTA 주장 2차 | — | zai-org/GLM-V |
| Qwen3-VL-235B-A22B | 2025-09 | 235B·A22B MoE | 80.6 2차 | — | OpenRouter |
| Qwen3-VL-32B (Thinking) | 2025-09 | 32B | 78.1 | 70.2 | arXiv:2511.21631 |
| InternVL3.5-241B-A28B | 2025-08 | 241B·A28B MoE | 77.7 | 63.9 | arXiv:2508.18265 |
| InternVL3.5-30B-A3B | 2025-08 | 30B·A3B MoE | 75.6 | 55.7 | arXiv:2508.18265 |
| Llama 4 Maverick | 2025-04 | 400B·A17B MoE | 73.4 | — | presenc 2차 |
| InternVL3-78B | 2025-04 | 78B | 72.2 | — | presenc 2차 |
| Qwen2.5-VL-72B | 2025-02 | 72B | 70.2 | — | presenc 2차 |
2026 상반기 신규(오픈). STEP3-VL-10B(2026-01, arXiv:2601.09668), Jan-v2-VL-Max(30B), DeepSeek V4(2026-04, 멀티모달 통합) 등이 이어졌으나 공개 비전 벤치 수치는 아직 정리 중이라 불확실로 둔다. GLM-4.6V(2025-12)는 9B Flash를 상업 이용 무료로 공개해 경량 온프레미스 선택지를 넓혔다.
프런티어(상용). 교차검증 결과 Gemini 3 Pro·Gemini 3.5 Flash·GPT-5.4·Meta muse-spark 등은 실존 확인됐다. 다만 LMArena Vision 스크랩(as-of 2026-07-21)상 상위권 Elo 1278~1318 같은 정확한 점수·순위와 OpenVLM 상용 평균은 원표 접근 실패로 미확인. 이 문서는 상용 순위를 단정하지 않는다.
오픈 vs 클로즈드
한 가지를 분리해 둔다: 오픈웨이트의 강점은 배치 제약(온프레미스·데이터주권) 우위이지, 그 자체로 모델 품질 우위는 아니다. 둘은 별개 축이다. 폐쇄망에서 진짜 갈리는 지점은 데이터가 망 경계를 넘느냐다.
| 계열 | 공개 | 라이선스 | 크기 | 온프레미스 |
|---|---|---|---|---|
| Qwen2.5-VL / Qwen3-VL | 오픈웨이트 | 모델별 상이(예: Qwen3-VL-235B Apache-2.0, Qwen2.5-VL-72B는 Qwen 라이선스) | 2B~72B, 235B MoE | 가능 |
| InternVL3 / 3.5 | 오픈웨이트 | MIT(계열별 확인 필요) | 8B~241B MoE | 가능 |
| DeepSeek-VL2 / Janus 계열 | 오픈웨이트 | 코드 MIT · 가중치 DeepSeek Model License | 1B~7B급 | 가능(경량) |
| Llama 4 (Maverick/Scout) | 오픈웨이트 | Llama 커뮤니티(제약 있음) | 100B~400B MoE | 대형 |
| GPT · Gemini · Claude · Grok | 클로즈드/API | 독점 | 비공개 | 공개 가중치 없음* |
태스크 적합성 (가이드라인)
아래는 동일 프로토콜 A/B 실험 결과가 아니라, 공개 벤치·모델카드 기반의 출발점 가이드다. 실제 선택은 자기 데이터로 재평가해야 한다.
- 범용 vision-language + 문서 OCR — Qwen3-VL / Qwen2.5-VL
- 문서 이해·차트 분석 — InternVL3(.5)
- 롱컨텍스트 멀티모달 챗 — Llama 4 Scout
- 경량·온디바이스 — Qwen2.5-VL-3B/7B, MiniCPM-V, Phi-vision
- GUI 에이전트(좌표 지목) — ScreenSpot-Pro 강자 확인 후 선택
- 비디오 — Video-MME(long)·MVBench로 검증, 긴 영상은 전반적으로 약함
관련 벤치: OmniDocBench(문서), OVBench·PerceptionTest(비디오), MobileWorld(GUI 그라운딩).
연계 사례 — 온프레미스·한국어 VLM 선택
위 조사가 실제 선택으로 이어진 작은 적용 사례. 지능형 CCTV의 2차 검증 레이어를 고르며 DeepSeek Janus 계열을 직접 추론·비교했다. 아래는 소표본 정성 관찰이며 정량 벤치가 아니다(표본 수·프롬프트·디코딩 설정·모델 버전을 통제한 실험이 아님) — 특정 모델의 일반 성능이 아니라 이 실험 조건에서의 경향으로만 읽어야 한다.
관찰 (한국어 장면 이해)
- Janus-Pro — 한국어 서술은 되지만 반복·환각(포스터 오독), 짧은 프롬프트 불안정.
- JanusFlow — 이해 태스크 사실상 실패("알 수 없습니다" 반복). 단, JanusFlow는 생성(Rectified Flow) 특화이므로 이해 잣대만으로 탈락시키는 건 불공정한 비교임을 명시한다.
- DeepSeek-VL2 (MoE) — OCR·문서 강점이나 한국어 질의에 중국어로 출력되는 문제.
구조 정리
Janus = 분리 인코더 + AR 생성 통합 / Janus-Pro = 직계 확장(1B·7B, 합성데이터) / JanusFlow = 분리 인코더 + Rectified Flow 별도 계열 / VL2 = 이미지 생성 없는 MoE 이해 특화.
온프레미스 VRAM (양자화 기준)
| 모델 | FP16 | Q4 | 비고 |
|---|---|---|---|
| Qwen2.5-VL-3B | ~8GB | ~6GB | 경량, 단일 소비자 GPU |
| Qwen2.5-VL-7B | ~12–16GB | ~10GB | 2차 검증에 현실적 |
| Qwen2.5-VL-72B | — | ~42GB | A100/H100급 필요 |
| DeepSeek Janus-Pro-7B | ~30GB+ | ~8–12GB | 생성 시 17–18GB |
선택 (결론이 아니라 정합적 판단)
폐쇄망 고보안 + 한국어 장면 2차 검증이라는 제약에서, 생성통합형(Janus/JanusFlow)이나 중국어 편향(VL2)보다 이해·한국어·온프레미스 안정성이 앞서 보인 Qwen2.5-VL을 2차 검증 레이어로 채택했다. 이는 위 정성 관찰과 정합적인 합리적 선택이지, 정량 검증을 통과한 최적성 증명은 아니다. Qwen2.5-VL 자체의 실패 모드(환각·한국어 OCR 오류·장문 붕괴)는 동일 강도로 측정하지 못했고, 한국어 전용 테스트셋·채점 기준을 세운 정량 A/B는 후속 과제로 남는다. 지금 시점(2026-07)에는 Qwen3-VL·InternVL3.5를 동일 조건에서 재평가하는 것이 자연스러운 다음 단계다.
점수를 읽는 6원칙
포화된 벤치는 절대치만으로 변별력이 낮다. DocVQA·ChartQA·TextVQA·AI2D·MMBench·MME·POPE는 상단이 뭉쳐 순위 결정을 맡기기 어렵다(단 오류 유형·신뢰구간을 보면 차이가 남기도 한다).
변별은 어려운 축에서. MMMU-Pro, MathVision, InfoVQA, HallusionBench(qAcc), ScreenSpot-Pro, Video-MME(long).
포맷 함정. 객관식=위치·선택지 편향, 개방형=LLM 채점기 의존, 이진=Yes 편향, Elo=장황함·스타일 영향.
"비전이 진짜 필요한가" 검증. MMStar의 멀티모달 게인이 낮은데 종합점수만 높으면 텍스트·암기 편법을 의심.
오염 경계. 경시·공개 데이터 기반(MathVision, RefCOCO)일수록 급격한 점프는 추론력 향상과 데이터 누출을 구분해 볼 것.
척도 단위 혼동 주의. MME 2800·OCRBench 1000·ANLS(0~1)·정확도 %·Elo를 섞어 읽지 말 것.
방법 · 교차검증 · 한계
벤치마크 해석과 리더보드는 리서치 서브에이전트가, 오픈/클로즈드·태스크·온프레미스는 직접 웹조사로 수집한 뒤, 세 개의 독립 CLI 에이전트로 사실성·편향·과신을 교차검증했다. 견제 과정에서 지적된 편향(소표본을 확정 결론처럼 서술, 배치 우위와 성능 우위 혼동, 목적이 다른 모델을 같은 잣대로 평가)은 본문 서술에 반영했다.
한계. 프런티어 상용 리더보드 원표(OpenVLM HF Space·아레나)는 JS 렌더링·403으로 완전 확보에 실패해 상용 순위·모델명은 불확실하다. 2차 집계는 갱신 지연으로 최신 오픈 모델이 누락될 수 있다. 연계 사례(§5)의 결과는 소표본 정성 관찰이다.
주요 출처: llm-stats.com · opencompass-open-vlm-leaderboard.hf.space · lmarena-ai(HF) · arXiv 2409.02813(MMMU-Pro) · 2403.20330(MMStar) · 2508.18265(InternVL3.5) · 2511.21631(Qwen3-VL) · presenc.ai · bentoml.com · HF 모델카드(Qwen2.5-VL·Janus-Pro).