O Qwen3.8-2.4T-A95B é a versão open-source do mais recente modelo principal da família Qwen, lançado em agosto de 2026. Sua arquitetura MoE esparsa conta com 2,4T de parâmetros no total e aproximadamente 95B ativados por etapa. O modelo combina atenção híbrida com uma janela de contexto de 1 milhão de tokens. Principais benchmarks: GPQA Diamond 92,6, PaperBench 93,0, OSWorld 86,1 e BabyVision 82,0. Alcançou a 4ª posição no CodeArena.
Provedor de service de inferência
O Alibaba Cloud Model Studio fornece o service de inferência para qwen3.8-2.4t-a95b.
Capacidades do modelo
Capacidade | Suporte | Capacidade | Suporte |
Modalidade de entrada | Text | Modalidade de saída | Text |
Experiência do modelo | Suportado | Function Calling | Suportado |
Saídas estruturadas | Suportado | Busca na web | Suportado |
Conclusão de prefixo | Suportado | Cache de contexto | Suportado |
Inferência em lote | Não suportado | Fine-tuning | Não suportado |
Limites de contexto
Parâmetro | Valor | Parâmetro | Valor |
|---|---|---|---|
Comprimento máximo de entrada | 991808 | Comprimento máximo de saída | 131072 |
Comprimento do contexto | 1000000 | Comprimento máximo de entrada (Modo de raciocínio) | 983616 |
Comprimento máximo de saída (Modo de raciocínio) | 131072 | Comprimento máximo da cadeia de pensamento | 131072 |
Preços
Esta página exibe apenas os preços originais das chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o console do Model Studio para consultar ofertas promocionais.
- China (Beijing)
- Singapore
Item de faturamento | Preço (USD) | Unidade |
Entrada | 1,65 | Por 1M de tokens |
Saída | 4.951 | Por 1M de tokens |
Entrada (Cache Hit) | 0,206 | Por 1M de tokens |
Criação explícita de cache | 2,063 | Por 1M de tokens |
Explicit Cache Hit | 0,137 | Por 1M de tokens |
Limites de taxa
- China (Beijing)
- Singapore
Parâmetro | Valor |
RPM (Requisições por minuto) | 5000 |
TPM (Tokens por minuto) | 5.000.000 |