GLM-5.3, Kimi K3, Qwen3.8-Max: 기능, 가격과 API 연결
GLM-5.3, Kimi K3, Qwen3.8-Max의 1차 기능 자료, Modelflare 현재 가격과 그룹, Chat Completions, Responses, Anthropic Messages 예제 및 운영 점검을 정리한 가이드입니다.
Modelflare에서 이제 glm-5.3, kimi-k3, qwen3.8-max를 하나의 호환 게이트웨이로 사용할 수 있습니다. 이 출시 가이드는 각 모델에 맞는 작업, 현재 USD 가격 스냅샷, 세 가지 요청 계약, API Key 생성부터 운영 검증까지의 안전한 연결 절차를 설명합니다.
아래 내용은 공급자 1차 문서와 Modelflare 카탈로그 사실을 구분합니다. 공급자가 말한 기능이 자동으로 게이트웨이에 노출되는 것은 아닙니다. 항상 최신 모델 항목과 클라이언트가 실제 호출하는 엔드포인트를 확인하세요.
변동 가능한 가용성, 그룹, 가격은 2026년 8월 29일에 확인했습니다. 그 이후에는 Modelflare 가격 페이지를 기준으로 사용하세요.
세 모델 한눈에 보기
| 모델 ID | 적합한 시작점 | 1차 자료의 기능 설명 | 컨텍스트와 추론 |
|---|---|---|---|
| glm-5.3 | 복잡한 코딩과 장기 Agent 작업 | Z.ai는 GLM-5.3을 어려운 코딩과 긴 Agent 작업에 적합하다고 설명하며 API에서 사고가 계속 활성화됨 | 사고는 항상 켜짐. 문서화된 수준은 low, high, max, 기본값은 max |
| kimi-k3 | 장문맥 코딩과 지식 작업 | Kimi는 네이티브 시각 이해와 장기간의 엔드투엔드 작업을 문서화함 | 최대 1M 컨텍스트. 사고 항상 켜짐. low, high, max, 기본 max |
| qwen3.8-max | 전문 워크플로와 장기 Agent | Qwen은 총 2.4T / 활성 95B MoE, 코딩, 시각 입력, 도구 중심 작업을 문서화함 | 1M 컨텍스트. 텍스트·이미지·비디오 입력과 텍스트 출력. 일부 도구는 지역과 엔드포인트에 따라 다름 |
공급자의 최신 표현은 GLM-5.3 발표, Kimi 모델 선택 가이드, Qwen3.8-Max 레퍼런스에서 확인할 수 있습니다. 벤치마크 수치는 공급자 보고이며 Modelflare의 보장이 아닙니다.
워크로드에 따라 선택하기
- 지속적인 계획, 어려운 코드 변경, 긴 Agent 루프가 필요하고 항상 켜진 추론 비용을 감당할 수 있다면 glm-5.3을 후보로 둡니다.
- 매우 큰 컨텍스트, 시각 이해, 엔드투엔드 지식 작업이 핵심이라면 kimi-k3을 후보로 둡니다.
- 1M Token 창, 멀티모달 입력, 구조화된 도구, 전문 자동화가 중요하다면 qwen3.8-max를 후보로 둡니다.
이는 출발점이지 보편적인 순위가 아닙니다. 민감 정보를 제거한 자체 작업 표본을 재생하고 성공 작업당 비용, 재시도, 지연, 검토 시간을 측정하세요. 큰 컨텍스트 한도는 상한일 뿐, 모든 위치에서 같은 유용성이나 속도를 보장하지 않습니다.
Modelflare 가격 스냅샷
아래 값은 현재 공개 그룹의 100만 Token당 USD 가격입니다. 그룹 배수는 0.8x로, 출시 공지의 “공식 가격 × 0.8” 표현과 같습니다.
| 모델 | 그룹 | 입력 | 출력 | 캐시 입력 |
|---|---|---|---|---|
| glm-5.3 | glm-stable | $1.12 | $3.52 | 약 $0.21 |
| kimi-k3 | kimi-stable | $2.40 | $12.00 | $0.24 |
| qwen3.8-max | qwen-stable | $1.60 | $4.80 | $0.20 |
값은 라이브 카탈로그의 입력 가격, completion 비율, 캐시 비율, 그룹 배수를 사용해 계산한 뒤 읽기 쉽게 반올림했습니다. 가격 페이지에 캐시 쓰기 필드가 따로 있다면 캐시 생성에는 그 값을 사용하고 읽기 가격에서 추정하지 마세요.
현재 세 그룹은 모두 rpm: 0으로 표시됩니다. 이는 플랫폼 측 고정 그룹 RPM 상한이 카탈로그에 설정되지 않았다는 뜻입니다. 공급자, 계정, 네트워크, 안전 제약은 여전히 적용될 수 있습니다. 가격과 가용성은 바뀌므로 실시간 가격 페이지와 사용 기록을 대조하세요.
하나의 게이트웨이와 세 API 계약
이 스냅샷에서 Modelflare 카탈로그는 세 모델 ID 모두 다음 공개 형식을 지원한다고 표시합니다.
| 계약 | 엔드포인트 | 인증 | 적합한 용도 |
|---|---|---|---|
| OpenAI Chat Completions | POST /v1/chat/completions | Authorization: Bearer | 기존 채팅 클라이언트와 호환 SDK |
| OpenAI Responses | POST /v1/responses | Authorization: Bearer | Responses 항목과 이벤트를 처리하는 클라이언트 |
| Anthropic Messages 호환 | POST /v1/messages | x-api-key 또는 Bearer와 anthropic-version | Anthropic 형태 클라이언트와 메시지 스트림 |
공통 OpenAI 호환 Base URL은 https://modelflare.dev/v1입니다. Anthropic SDK는 보통 https://modelflare.dev를 Base URL로 사용하고 /v1/messages를 붙입니다. 엔드포인트 가용성은 기능 동등성을 뜻하지 않습니다. 스트리밍 이벤트, 도구, 구조화 출력, 멀티모달 입력, 추론 제어를 각각 검증하세요.
Modelflare에 연결하기
- API Keys에서 키를 생성하거나 업데이트하고 원하는 모델이 있는 glm-stable, kimi-stable, qwen-stable 그룹을 부여합니다.
- 키는 환경 변수에 보관합니다. 저장소, 브라우저 저장소, 지원 티켓에 넣지 마세요.
- 같은 키로 인증된 /v1/models 응답을 확인한 다음 정확한 ID로 작은 비스트리밍 요청을 보냅니다.
- Agent나 사용자 트래픽을 옮기기 전에 스트리밍을 별도 계약으로 시험합니다.
Chat Completions
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "마이그레이션 위험을 세 항목으로 요약하세요."}],
"stream": false
}'
Responses API
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"input": "안전한 데이터베이스 마이그레이션의 짧은 점검표를 반환하세요.",
"stream": false
}'
Anthropic Messages
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"max_tokens": 256,
"messages": [{"role": "user", "content": "첫 세 가지 배포 점검을 나열하세요."}]
}'
예제는 의도적으로 일반 텍스트와 stream: false를 사용합니다. 클라이언트가 선택한 계약의 이벤트 형식을 처리한 뒤 스트리밍을 켜세요. 의미가 있는 명시적 0과 false를 보존하고, 계약을 확인하지 않은 공급자 전용 필드를 다른 모델로 복사하지 마세요.
운영 전 검증
- 같은 키로 모델 목록을 가져와 정확한 ID와 그룹이 보이는지 확인합니다.
- 애플리케이션이 실제 호출할 엔드포인트에서 비스트리밍과 스트리밍을 각각 한 번 시험합니다.
- 도구, 구조화 출력, 이미지, 비디오, 추론 제어를 쓴다면 선택 모델에서 각 기능을 따로 시험합니다. 텍스트 응답 성공만으로 다른 기능이 증명되지 않습니다.
- 사용 기록에서 상태, 선택 그룹, 입력·출력·캐시 Token, 지연, 재시도, 최종 과금을 저장합니다.
- 애플리케이션 재시도를 제한하고 일시적인 용량 응답과 종료형 모델 또는 정책 오류를 구분합니다.
- 대량 호출 전에 실시간 가격을 다시 확인합니다. 가격 페이지와 사용 기록이 복사된 표보다 우선합니다.
자주 묻는 질문
이 가격은 고정인가요? 아닙니다. 날짜가 있는 카탈로그 스냅샷이며 실시간 가격 페이지가 기준입니다.
rpm: 0은 무제한 트래픽인가요? 아닙니다. 플랫폼 측 그룹 RPM 상한이 설정되지 않았다는 뜻일 뿐입니다. 공급자, 계정, 네트워크, 안전 제한은 적용될 수 있습니다.
같은 payload를 세 프로토콜에 보낼 수 있나요? 아닙니다. 모델 ID는 유지하되 선택 계약에 맞춰 봉투, 인증, 응답 파서, 스트리밍 처리를 조정해야 합니다.
1M 컨텍스트가 문서화된 모델은 무엇인가요? Kimi K3와 Qwen3.8-Max는 연결된 1차 자료에 1M이 명시되어 있습니다. 이 페이지는 GLM-5.3에 1M을 주장하지 않습니다.
출처와 최신성
- Z.ai: GLM-5.3
- Kimi API 모델 선택
- Alibaba Cloud Model Studio: Qwen3.8-Max
- Modelflare 실시간 가격
- Modelflare Qwen3.8-Max 상세 가이드
- OpenAI 호환 API 가이드
- Responses API와 Chat Completions
업데이트 기록: 2026년 8월 29일 — 최초 작성. 1차 기능 페이지, Modelflare 그룹, 엔드포인트 표시, 가격을 같은 날 확인했습니다.