Skip to main content
Text Generation

deepseek-v4.1-flash

DeepSeek-V4.1-Flash adalah unggulan ringan dari keluarga arsitektur baru DeepSeek, yang memadatkan total parameter MoE sebanyak 552B untuk menghadirkan kecerdasan melampaui unggulan di berbagai tolok ukur utama, termasuk mengungguli DeepSeek-V4-Pro. Model ini mengadopsi desain asimetris Causal Encoder-Decoder dengan parameter aktif sebanyak 8B untuk input dan 16B untuk output, serta menawarkan pemahaman visual multimodal native. Penggunaan KV Cache dipangkas hingga seperempat dari HBM generasi sebelumnya dan seperdelapan dari penyimpanan SSD-nya, sehingga secara drastis menurunkan biaya untuk beban kerja konteks panjang dan agentic. Dengan jendela konteks sebesar 1M token dan output maksimum hingga 384K token, model ini menyeimbangkan throughput tinggi, latensi rendah, dan efisiensi biaya yang luar biasa.

Penyedia Layanan Inferensi

Penyedia layanan inferensi untuk deepseek-v4.1-flash adalah Alibaba Cloud Model Studio.

Kemampuan Model

  • Tiongkok (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • AS (Virginia)
  • Japan (Tokyo)
KemampuanDukunganKemampuanDukungan

Modalitas Input

Teks, Gambar

Modalitas Output

Teks

Pengalaman Model

Didukung

Function Calling

Didukung

Structured Outputs

Didukung

Pencarian Web

Didukung

Prefix Completion

Tidak Didukung

Caching Konteks

Didukung

Inferensi Batch

Tidak Didukung

Fine-tuning

Tidak Didukung

Batas Konteks

ParameterNilaiParameterNilai

Panjang Input Maksimum

1000000

Panjang Output Maksimum

393216

Jendela Konteks

1000000

Panjang Input Maksimum (Mode Berpikir)

1000000

Panjang Output Maksimum (Mode Berpikir)

393216

Panjang Chain-of-Thought Maksimum

393216

Harga

Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi waktu terbatas. Kunjungi Konsol Model Studio untuk penawaran promosi. Jam idle berlangsung pukul 22.00 hingga 08.00 hari berikutnya (UTC+8); waktu lainnya adalah jam sibuk.
  • Tiongkok (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • AS (Virginia)
  • Japan (Tokyo)
Item PenagihanHarga (USD)Unit

Input (Jam idle)

0.141

Per 1M token

Input (Jam sibuk)

0.283

Per 1M token

Output (Jam idle)

0.565

Per 1M token

Output (Jam sibuk)

1.131

Per 1M token

Input(Cache Implisit, Jam idle)

0.014

Per 1M token

Input(Cache Implisit, Jam sibuk)

0.028

Per 1M token

Batas Laju

  • Tiongkok (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • AS (Virginia)
  • Japan (Tokyo)
  • Hong Kong (Tiongkok)
ParameterNilai

RPM (Permintaan Per Menit)

15000

TPM (Token Per Menit)

1,200,000

Rencana Token (Team Edition)
Model playground
  • Pembuatan audio
  • Pembuatan musik
Statistik dan Pemantauan
Asset Center
Dukungan layanan