본문 바로가기
Tech

DeepSeek V4 Flash Vision Exp API 가격·사용법: 딥시크 비전 모델 한국어 되나

by 생각소년 2026. 9. 1.

딥시크 V4 플래시 비전 Exp(DeepSeek-V4-Flash-Vision-Exp)는 2026년 8월 31일 공개된 실험형 멀티모달 모델입니다. API 입력 100만 토큰당 0.22달러(약 301원)입니다.

 

기존 DeepSeek-V4-Flash에 시각 모듈을 더해 이미지 설명, 스크린샷 문자 인식, 차트 분석을 지원합니다. API 모델명은 deepseek-v4-flash-vision-exp이고, 토큰 단가는 기존 V4 Flash와 같습니다.

기존 DeepSeek API에 이미지 입력을 추가하려는 개발자가 시험해볼 만합니다. 다만 아직 실험 모델이라 운영 서비스에는 신중하게 적용해야 합니다.

 

허깅페이스에 공개된 DeepSeek V4 Flash Vision Exp 공식 모델 페이지 미리보기

이 글에서 다루는 내용

1. DeepSeek V4 Flash Vision Exp란?

DeepSeek는 이 모델을 DeepSeek-V4 계열의 첫 실험형 멀티모달 모델이라고 소개합니다. DeepSeek-V4-Flash 아키텍처에 시각 모듈을 더한 뒤 추가 학습해 이미지 이해 능력을 구현했습니다.

 

공식 자료도 정식 안정판이 아닌 experimental model로 분류합니다. 허깅페이스 저장소는 2026년 8월 31일 06시 16분(UTC), 한국 시간 같은 날 15시 16분에 생성됐습니다. 저장소는 공개 상태이며 라이선스는 MIT입니다.

2. 이번 발표에서 확인된 핵심 기능

  • 이미지와 텍스트 동시 입력: 사진을 설명하거나 이미지에 관해 질문할 수 있습니다.
  • 스크린샷 문자 읽기: 화면에 표시된 글자를 읽고 내용을 분석할 때 쓸 수 있습니다.
  • 차트 분석: 그래프와 차트에 담긴 정보를 텍스트 질문과 함께 해석할 수 있습니다.
  • 네 가지 이미지 형식: JPEG, PNG, GIF, WebP를 지원합니다.
  • 세 가지 전송 방식: Base64 인라인 데이터, 외부 이미지 URL, Files API의 file_id를 사용할 수 있습니다.
  • 생각 모드: non-thinking과 thinking 모드를 모두 지원하며 기본값은 thinking입니다.
  • 에이전트 기능: JSON 출력, 도구 호출, Responses API, Anthropic API, Chat Prefix Completion을 지원합니다.

다만 이미지 이해가 곧 이미지 생성이나 영상 분석을 뜻하지는 않습니다. 공식 문서가 명시한 범위는 이미지 입력을 활용한 설명, 스크린샷 읽기, 차트 분석입니다.

3. API 사용 방법

전용 API 주소는 따로 쓰지 않습니다. 기존 DeepSeek OpenAI 호환 주소인 https://api.deepseek.com에서 모델명만 deepseek-v4-flash-vision-exp로 지정하면 됩니다.

API 키는 DeepSeek Platform에서 발급받아야 합니다. 이미지 입력 형식은 공식 Vision 가이드에서 확인할 수 있습니다.

먼저 pip install openai로 SDK를 설치합니다. API 키는 코드에 직접 적지 말고 DEEPSEEK_API_KEY 환경변수에 저장하세요.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "이 이미지의 핵심 내용을 설명해줘."},
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/image.jpg"
                    }
                }
            ]
        }
    ]
)

print(response.choices[0].message.content)

외부 URL 방식은 URL 길이가 8,192자 이하여야 하며 이미지 파일은 최대 32 MiB까지 허용됩니다. 서버가 60초 안에 이미지를 가져올 수 있어야 합니다.

 

같은 이미지를 반복해서 쓴다면 최대 64MiB를 허용하는 Files API가 더 알맞습니다. Base64 인라인 방식은 전체 요청 본문 48 MiB 제한에 포함됩니다.

 

요청당 이미지는 최대 600개이며, 이미지 한 변은 기본적으로 최대 8,192픽셀입니다. 단, 이미지가 15개 이상이면 한 변 제한이 4,096픽셀로 낮아집니다.

 

이미지는 user 메시지에만 넣을 수 있습니다. system이나 assistant 메시지에 넣으면 400 오류가 발생합니다.

DeepSeek 공식 API 문서의 딥시크 로고 이미지

4. API 가격과 원화 환산

공식 가격표에 따르면 DeepSeek V4 Flash Vision Exp에는 DeepSeek V4 Flash와 같은 토큰 단가가 적용됩니다. 아래는 100만 토큰 기준입니다.

구분 비혼잡 시간 혼잡 시간 원화(비혼잡)
캐시 적중 입력 0.007달러 0.014달러 약 10원
캐시 미적중 입력 0.22달러 0.44달러 약 301원
출력 0.66달러 1.32달러 약 903원

원화는 2026년 8월 31일 기준 환율 1달러 1,368.03원으로 환산한 참고값입니다. 환율에 따라 달라집니다.

이미지는 크기에 따라 토큰으로 변환돼 텍스트 입력 토큰과 함께 청구됩니다. 공식 Vision 문서 기준 이미지 한 장은 자동 리사이즈 후 최대 384토큰을 사용합니다.

캐시 미적중 입력 단가만 단순 적용하면 이미지 한 장의 입력 비용 상한은 비혼잡 시간 약 0.00008448달러입니다. 실제 규모로 환산하면 아래와 같습니다.

이미지 수량 입력 비용(비혼잡) 원화
1,000장 약 0.084달러 약 116원
10,000장 약 0.845달러 약 1,156원

이 계산은 이미지 입력분만 반영한 값입니다. 텍스트 입력과 출력 비용은 별도로 붙습니다.

컨텍스트 길이는 100만 토큰이며 최대 출력은 38만 4천 토큰입니다. 공식 문서가 정한 혼잡 시간은 월요일부터 금요일까지 01:00~04:00 UTC와 06:00~10:00 UTC입니다.

 

한국 시간으로 바꾸면 평일 오전 10시~오후 1시와 오후 3시~7시입니다. 국내 업무 시간이 혼잡 시간과 거의 겹치므로, 배치 처리는 밤이나 새벽으로 돌리면 단가가 절반이 됩니다.

가격은 바뀔 수 있으니 실제 도입 전 공식 가격 페이지를 다시 확인해야 합니다. 이 글의 가격 최종 확인일은 2026년 9월 1일입니다.

5. 한국에서 쓸 때 확인할 것

한국 사용자가 실제로 걸리는 지점은 가격표에 안 나옵니다. 아래 네 가지를 먼저 확인하세요.

  • 한국어 OCR은 검증되지 않았습니다. 공식 문서는 스크린샷 문자 읽기를 안내하지만, 한국어만 따로 측정한 수치는 공개하지 않았습니다. 공개된 Chartography 64.3점, ZeroBench 35.0점도 한국어 기준이 아닙니다. 한글 화면 몇 장으로 직접 확인한 뒤 판단해야 합니다.
  • 결제는 달러 기준입니다. DeepSeek Platform에서 선불 충전 방식으로 쓰며, 원화 결제가 아니라 해외 결제로 잡힙니다. 카드사 해외 결제 수수료가 별도로 붙습니다.
  • 혼잡 시간이 국내 업무 시간과 겹칩니다. 위에서 본 대로 평일 낮 시간대가 대부분 혼잡 시간이라 단가가 두 배입니다. 대량 배치는 시간대를 옮기는 것만으로 비용이 절반이 됩니다.
  • 민감 자료는 정책 확인이 먼저입니다. 신분증, 계약서, 고객 화면을 중국 소재 API로 보내기 전에 사내 개인정보·보안 정책을 확인해야 합니다. 공공기관이나 금융권은 사전 검토가 필요한 경우가 많습니다.

국내에서 쓸 수 있는 대안을 찾는 단계라면, 먼저 로컬 실행이 가능한 소형 모델부터 비교해 보는 편이 낫습니다. Qwable·Qwen 로컬 AI 모델 가이드에서 모델 크기와 실행 환경 기준을 정리해 두었습니다.

6. 기존 V4 Flash와의 차이

이름이 비슷해 헷갈리기 쉽습니다. DeepSeek-V4-Flash는 2026년 4월 공개된 텍스트 모델이고, Vision Exp는 8월 31일 공개된 별개 모델입니다.

  • 입력 방식: DeepSeek-V4-Flash-0731은 텍스트 중심 모델이고 Vision Exp는 텍스트와 이미지를 함께 받습니다.
  • 멀티모달 에이전트: Vision Exp는 스크린샷, 차트, 사진을 도구 실행 흐름에서 분석하도록 설계됐습니다.
  • 텍스트 작업: 공식 모델 카드는 기존 Flash와 비슷한 텍스트 전용 에이전트 성능을 유지한다고 설명합니다.
  • API 가격: 두 모델의 공식 토큰 단가는 같습니다. Vision Exp는 이미지가 입력 토큰으로 추가 과금됩니다.
  • 안정성: Vision Exp는 공식 설명에서 실험 모델로 분류됩니다. 운영 환경에서는 회귀 테스트와 대체 모델이 필요합니다.

7. 공식 벤치마크 성능

DeepSeek가 공개한 자체 평가를 보면 텍스트 에이전트 성능은 대체로 유지됐고 멀티모달 에이전트 성능은 개선됐습니다.

벤치마크 Vision Exp V4-Flash-0731
ApexBench Pass@1 36.5 26.2
Agents' Last Exam 27.3 25.2
DeepSWE 59.3 54.4
Toolathlon-Verified 75.9 70.3
Chartography 64.3
ZeroBench Pass@5 35.0

ApexBench 비교값은 이미지 요소를 무시한 조건에서 측정된 DeepSeek-V4-Flash-0731의 점수입니다.

이 수치는 DeepSeek가 모델 카드에 공개한 결과입니다. 텍스트 에이전트 평가는 DeepSeek Harness 최소 모드, reasoning effort max, temperature 1.0, top_p 0.95 조건에서 진행됐습니다.

실제 한국어 OCR, 복잡한 표, 업무용 화면 분석 성능은 사용자가 다루는 데이터로 별도 검증해야 합니다.

8. 로컬 실행 가능 여부

가능합니다. 공식 허깅페이스 저장소에는 토크나이저, 프롬프트 인코딩 참조 코드, 최소 PyTorch 추론 구현과 모델 가중치가 공개돼 있습니다. 모델 카드는 Transformers의 image-text-to-text 파이프라인을 표시하며 라이선스는 MIT입니다.

다만 가벼운 로컬 모델은 아닙니다. 허깅페이스 API 메타데이터 기준 전체 파라미터는 약 3,046억 개이고 저장소 사용량은 약 167.8GB입니다.

 

일반 노트북이나 메모리가 작은 미니 PC에서 곧바로 돌릴 만한 크기가 아닙니다. 대용량 모델용 기기를 고르는 중이라면 M6 맥 미니와 M5 Pro 비교 가이드에서 메모리 구성 기준을 참고할 수 있습니다.

실제 로컬 실행 가능 여부는 시스템 메모리, 양자화 형식, 추론 엔진 지원과 여유 저장공간을 따로 확인해야 합니다.

9. 사용 전 확인할 제한사항

  • 실험 모델: 이름뿐 아니라 공식 문서에서도 experimental model로 설명합니다. 운영 서비스에 곧바로 고정하기보다는 테스트와 대체 모델 계획이 필요합니다.
  • 이미지 비용: 이미지 크기에 따라 입력 토큰이 늘어납니다. detail: low는 이미지를 512×512로 축소해 처리하므로 세밀한 글자 판독이 필요 없을 때 비용을 줄일 수 있습니다.
  • FIM 미지원: Fill-in-the-Middle Completion 베타 기능은 이 비전 실험 모델에서 지원하지 않습니다.
  • 벤치마크 해석: 공개 점수는 특정 하네스와 설정에서 측정됐습니다. 다른 프롬프트와 도구 환경에서는 결과가 달라질 수 있습니다.

10. 누가 써볼 만한가

스크린샷과 차트를 다루는 AI 에이전트를 만들거나, 기존 DeepSeek API 흐름에 이미지 입력을 추가하려는 개발자에게 특히 유용합니다.

OpenAI 호환 Chat Completions 형식을 그대로 두고 모델명만 바꾸면 되므로 초기 실험도 비교적 쉽게 시작할 수 있습니다.

 

반면 이미지 생성 모델을 찾거나, 검증된 안정판이 필요하거나, 소형 PC에서 손쉽게 돌릴 로컬 모델을 원하는 경우에는 우선순위가 낮습니다. 정식 안정판과 추론 엔진 지원, 장비별 메모리 요구량이 더 확인될 때까지 기다리는 편이 낫습니다.

자주 묻는 질문

DeepSeek V4 Flash Vision Exp는 정식 안정판인가요?

아닙니다. DeepSeek가 공식적으로 실험형 멀티모달 모델이라고 밝힌 모델입니다.

이미지와 PDF를 모두 입력할 수 있나요?

공식 Vision 문서는 JPEG, PNG, GIF, WebP 이미지 입력을 명시합니다. PDF를 이미지와 같은 방식으로 직접 받는다고 단정할 근거는 없습니다. PDF는 페이지를 이미지로 변환하거나 별도 파일 지원 범위를 확인해야 합니다.

API에서 어떤 모델명을 사용하나요?

deepseek-v4-flash-vision-exp를 사용합니다. OpenAI 호환 base URL은 https://api.deepseek.com입니다.

무료로 사용할 수 있나요?

공식 API는 토큰 사용량에 따라 과금됩니다. 허깅페이스 가중치는 MIT 라이선스로 공개됐지만, 로컬 실행에는 충분한 저장공간과 메모리·연산 자원이 필요합니다.

한국어 OCR 성능이 검증됐나요?

공식 문서는 스크린샷의 문자 읽기 기능을 안내하지만, 한국어 OCR만을 따로 검증한 수치는 제시하지 않습니다. 한글이 많은 실제 화면으로 정확도를 직접 확인해야 합니다.

이미지 생성도 가능한가요?

공식 자료에서 확인되는 기능은 이미지 이해와 분석입니다. 이미지 생성 기능을 지원한다고 해석하면 안 됩니다.

정리

DeepSeek V4 Flash Vision Exp는 기존 DeepSeek-V4-Flash 계열에 이미지 입력과 시각 이해를 추가한 모델입니다. 100만 토큰 컨텍스트, OpenAI·Anthropic 호환 API, MIT 라이선스 공개 가중치를 갖췄습니다.

덕분에 개발자가 빠르게 시험해 보기 좋습니다.

 

다만 아직 실험 모델이며 대규모 로컬 실행 비용과 이미지 토큰 과금, 한국어 OCR 성능은 별도 검증이 필요합니다. 우선 API에서 실제 업무 이미지 몇 종류를 테스트해 정확도와 비용을 확인한 뒤 적용 범위를 넓히는 방식이 안전합니다.

출처

최종 확인: 2026년 9월 1일 KST. 실험 모델의 사양과 가격은 변경될 수 있습니다.

글쓴이: 생각소년. 생각소년 소개 보기

댓글