Qwen3.8-Max 출시: 2.4T MoE 사양 및 Modelflare 설정

Qwen3.8-Max의 2.4T/95B MoE, 1M 멀티모달 컨텍스트, 추론 설정, 현재 Modelflare 가격 및 권장 도입 구성을 설명합니다.

Qwen 팀은 2026년 8월 3일 Qwen3.8-Max를 정식 출시했습니다. 혼동하기 쉬운 이전 모델 Qwen3-8B가 아니며, 7월의 qwen3.8-max-preview 상태에 머물러 있지도 않습니다. 현재 공식 API 모델 ID는 qwen3.8-max이고 Modelflare도 동일한 ID를 사용합니다.

Qwen3.8-Max는 현재 Qwen에서 가장 큰 Max 플래그십 모델로, 코딩, 전문 워크플로, 장기 Agent, 네이티브 멀티모달 작업을 주요 대상으로 합니다. Qwen은 Qwen3.8-Max와 Qwen3.8-27B의 오픈 웨이트를 다음 주에 공개하겠다고 함께 발표했습니다. 실제 저장소와 라이선스가 공개되기 전까지는 “오픈 웨이트 공개 예정”이라고 표현하는 것이 정확하며, “이미 로컬 배포 가능”하다고 말할 수는 없습니다.

핵심 사양

항목 Qwen3.8-Max
Modelflare 모델 ID qwen3.8-max
아키텍처 Mixture-of-Experts(MoE)
전체 파라미터 2.4T
Token당 활성 파라미터 95B
컨텍스트 길이 1M tokens
비사고 모드 최대 입력 991K tokens
Thinking mode 최대 입력 983K tokens
최대 출력 131K tokens
최대 추론 Token 262K tokens
입력 모달리티 텍스트, 이미지, 동영상
출력 모달리티 텍스트
추론 강도 low, medium, xhigh; 기본값 xhigh
공식 기능 Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch, Responses 내장 도구

2.4T는 모델 전체의 파라미터 수이며, Token 하나를 생성할 때마다 2.4T 전체를 실행한다는 뜻은 아닙니다. 공식 발표는 활성 파라미터를 95B로 제시하며, 이 수치가 MoE 추론에 실제로 참여하는 연산 규모를 이해하는 데 더 유용합니다. 1M 컨텍스트도 모든 요청을 한도까지 채워야 한다는 뜻이 아닙니다. 입력과 추론 예산이 커질수록 지연 시간, 캐시, 비용을 별도로 설계해야 합니다.

Qwen3.8-Max가 목표로 하는 영역

Qwen은 이번 출시를 코딩과 Cowork의 전반적인 업그레이드로 소개하며 다음 세 가지 작업을 강조합니다.

  • 개별 함수 생성에 그치지 않고 빈 디렉터리에서 시작해 여러 날이 걸리는 소프트웨어 프로젝트를 완수하는 작업.
  • 연구, 데이터 분석, Office, 디자인 등 전문 업무에서 여러 단계의 결과물을 구성하는 작업.
  • 한 번의 정적 인식이 아니라 계획, 실행, 검증 전 과정에서 이미지와 동영상 이해를 사용하는 작업.

Qwen은 10일이 넘는 자율 코딩과 수백 턴의 반도체 설계 최적화 같은 공급자 시연을 공개했습니다. 이는 Harness, 도구, 환경, 프롬프트, 평가 방식의 영향을 함께 받는 시스템 수준 사례이므로 사용자의 애플리케이션에서도 같은 결과가 나온다는 보장은 없습니다. 프로덕션 모델 선정에서는 자체 저장소, 문서, 도구 권한, 합격 기준으로 고정 샘플 평가를 수행해야 합니다.

추론 강도 선택 방법

Qwen3.8-Max는 reasoning_effort를 지원합니다.

  • low: 짧은 질문, 가벼운 코드 설명, 비용에 민감한 작업.
  • medium: 일상 개발, 분석, 여러 단계 작업의 출발점.
  • xhigh: 어려운 추론, 장기 Agent, 복잡한 전문 작업. 기본값이기도 합니다.

Qwen에 따르면 preserve_thinking은 기본으로 활성화되어 멀티턴 작업이 이전 추론 상태를 이어갈 수 있습니다. 클라이언트가 메시지 기록을 직접 재구성한다면 최종 텍스트만 이어 붙이지 말고 공급자가 반환한 추론 필드와 도구 상태를 유지하세요. 최대 262K 추론 tokens를 사용할 수 있지만, 사용 가능한 상한이 권장 기본값은 아닙니다. 작업 성공률과 단위 비용을 기준으로 effort를 선택해야 합니다.

현재 Modelflare 지원 범위

2026년 8월 4일 기준 Modelflare는 qwen3.8-max를 다음 프로토콜로 제공합니다.

  • OpenAI Chat Completions
  • OpenAI Responses
  • Anthropic Messages 호환 엔드포인트

프로토콜 표시는 경로가 존재한다는 것만 의미하며, QwenCloud 전용 기능이 모두 자동으로 전달된다는 뜻은 아닙니다. QwenCloud는 web_search, code_interpreter, web_extractor, t2i_search, i2i_search를 Responses 내장 도구로 안내합니다. 각 기능을 실제 Modelflare 대상 경로에서 검증하기 전까지는 클라이언트 정의 Function Calling을 우선 사용하고 내장 도구는 미검증 기능으로 취급하세요.

현재 qwen-award 그룹의 공개 가격은 다음과 같습니다. 단위는 100만 tokens당 미국 달러입니다.

과금 항목 가격
입력 $1.239
출력 $3.71
캐시 읽기 $0.161
명시적 캐시 생성 $1.547
1시간 명시적 캐시 생성 $2.4752

이 그룹은 자격이 있는 API Keys에만 제공됩니다. 가격, 자격, 프로토콜 범위는 변경될 수 있으므로 모델 및 가격과 요청별 사용량 로그를 최신 기준으로 사용하세요.

권장 Chat Completions 설정

먼저 Modelflare API Key를 환경 변수에 저장합니다.

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

텍스트 요청으로 기본 경로부터 검증합니다.

curl -N -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Design a safe rollout plan for this service and include validation and rollback gates."
      }
    ],
    "reasoning_effort": "medium",
    "stream": true
  }'

medium으로 품질, 지연 시간, 비용 기준을 먼저 만들고 실제로 더 깊은 추론이 필요한 작업만 xhigh로 올리세요. 업스트림 기본값이 xhigh라는 이유만으로 모든 배치 요청에 최대 추론 예산을 줄 필요는 없습니다.

멀티모달 입력 도입 방법

공식 모델은 텍스트, 이미지, 동영상을 입력으로 받지만 멀티모달 콘텐츠 형식은 프로토콜과 업스트림 구현에 따라 다릅니다. 다음 세 단계로 도입하는 것이 좋습니다.

  1. 텍스트 요청만으로 인증, 모델 권한, 스트리밍, 과금을 먼저 검증합니다.
  2. 고정된 테스트 이미지 한 장으로 콘텐츠 형식, 크기 제한, 출력을 검증합니다.
  3. 이후에 긴 동영상, 도구, 멀티턴 시각 피드백을 추가하고 재시도가 과금 대상 작업을 중복시키는지 확인합니다.

이미지 URL, Base64 payload, 파일 업로드, 공급자 오브젝트 스토리지를 서로 바꿔 쓸 수 있는 동일 프로토콜로 취급하지 마세요. 클라이언트가 실제로 전송할 콘텐츠 블록을 그대로 엔드투엔드 검증해야 합니다.

권장 플랫폼 설정

  1. 애플리케이션별로 독립된 API Key를 사용하고 기본 그룹에 qwen3.8-max가 실제로 표시되는지 확인합니다.
  2. 일상 개발과 분석은 medium부터 시작하고, 짧은 작업은 low, 어려운 장기 작업만 xhigh로 높입니다.
  3. 긴 컨텍스트 작업은 분할과 캐시를 설계하고 모든 요청에 지식 베이스 전체를 1M 컨텍스트로 넣지 않습니다.
  4. Chat Completions, Responses, Anthropic의 wire contract를 각각 검증합니다.
  5. 공급자 내장 도구는 대상 Modelflare 경로에서 실제 요청을 통과하기 전까지 프로덕션 의존성으로 사용하지 않습니다.
  6. 고정 작업 세트로 성공률, 첫 출력, 전체 지연 시간, 추론 Token, 캐시 적중, 요청당 비용을 비교합니다.
  7. preview에서 정식 모델로 이동할 때 회귀 샘플을 다시 실행하고 같은 제품군 이름이 동일한 출력을 보장한다고 가정하지 않습니다.

적합한 용도와 주의할 용도

Qwen3.8-Max는 복잡한 소프트웨어 엔지니어링, 여러 단계의 전문 워크플로, 긴 문서와 동영상 이해, 멀티모달 피드백을 사용하는 Agent, 하나의 플래그십으로 추론과 오케스트레이션을 통합하려는 팀에 적합합니다. 처리량이 높고 지연 시간이 낮아야 하는 단순 텍스트 변환에서는 가장 경제적인 기본값이 아닐 수 있습니다. 동일한 입력으로 Qwen Flash, DeepSeek V4 Flash 또는 다른 소형 모델과 비용과 지연 시간을 비교하세요.

출처와 업데이트 날짜

이 글의 확인 날짜는 2026년 8월 4일입니다. 오픈 웨이트 상태, 모델 스냅샷, 가격, 프로토콜 지원 범위는 바뀔 수 있으므로 프로덕션 설정에서는 호출 시점의 공식 모델 페이지, 웨이트 저장소 라이선스, Modelflare 실시간 카탈로그를 확인하세요.