DeepSeek resmi merilis DeepSeek V4 Flash 0731 pada 31 Juli 2026. Model ini keluar dari status preview menjadi rilis publik. Yang menarik, justru varian Flash, bukan flagship V4 Pro, yang pertama kali resmi dirilis. Dengan arsitektur 284 miliar parameter total dan hanya 13 miliar aktif, model ini menawarkan skor agen yang melampaui V4 Pro Preview, harga yang jauh lebih murah, dan dukungan native terhadap Responses API.
Artikel ini membedah apa yang baru di DeepSeek V4 Flash 0731, skor benchmark yang diklaim, struktur harganya, cara mengaksesnya, dan opini pribadi apakah model ini layak masuk pipeline AI.
DeepSeek V4 Flash adalah varian ringan dalam lini V4 DeepSeek, dirancang untuk deployment yang hemat biaya. Rilis 0731 menandai keluar dari fase preview ke public beta dengan identifier model deepseek-v4-flash. Arsitekturnya tidak berubah dari versi April: sparse mixture-of-experts dengan 284 miliar parameter total dan 13 miliar aktif saat inference.
Yang berubah adalah re-post-training. DeepSeek menyebut build 0731 ini lebih fokus pada kemampuan agen, dengan skor benchmark yang diklaim jauh melampaui V4 Pro Preview di sejumlah pengujian.
Konteks model ini juga penting. DeepSeek membangun reputasi lewat model open-weight seperti V3 dan V3.2 yang mampu bersaing dengan GPT-5. Kini, dengan V4, DeepSeek mengambil arah yang berbeda. V4 Flash 0731 dirilis sebagai model proprietary yang hanya tersedia melalui API. Ini adalah pergeseran signifikan dari strategi lama DeepSeek.
V4 Flash 0731 menggunakan arsitektur sparse mixture-of-experts. Artinya, meski total parameternya mencapai 284 miliar, hanya 13 miliar parameter yang aktif saat setiap token diproses. Pendekatan ini memungkinkan model tetap responsif dan hemat biaya tanpa mengorbankan kapasitas pengetahuan secara keseluruhan.
Spesifikasi lengkapnya adalah sebagai berikut:
| Spesifikasi | Nilai |
|---|---|
| Total parameter | 284 miliar |
| Parameter aktif | 13 miliar |
| Panjang konteks | 1 juta token |
| Output maksimum | 384 ribu token |
| Mode thinking | Non-thinking dan thinking (default) |
| JSON output | Ya |
| Tool calls | Ya |
| Responses API | Ya |
| Anthropic API | Ya |
| FIM completion | Non-thinking mode saja |
Panjang konteks 1 juta token merupakan salah satu yang terbesar di kelasnya. Ini menempatkan V4 Flash dalam posisi yang nyaman untuk beban kerja dokumen panjang, analisis kode besar, dan alur agen multi-langkah yang membutuhkan banyak konteks.
Output maksimum 384 ribu token juga tidak biasa. Sebagian besar model kompetitor menawarkan output yang jauh lebih pendek. Kemampuan ini berguna untuk tugas yang menghasilkan dokumen sangat panjang seperti laporan, kode besar, atau rangkaian respons agen.
DeepSeek melaporkan empat skor benchmark utama yang berfokus pada kemampuan agen. Perlu dicatat, angka ini merupakan klaim vendor, bukan hasil verifikasi independen. Skor tersebut adalah:
| Benchmark | Skor V4 Flash 0731 |
|---|---|
| Terminal-Bench 2.1 | 82,7% |
| CyberGym | 76,7% |
| Toolathlon-Verified | 70,3% |
| AutomationBench | 25,1% |
Terminal-Bench 2.1 mengukur kemampuan model menyelesaikan tugas di lingkungan terminal yang sebenarnya. Skor 82,7 persen adalah angka yang tinggi untuk kategori ini. CyberGym menilai kemampuan agen di lingkungan keamanan siber. Toolathlon-Verified mengukur seberapa baik model menggunakan tool secara tepat dan terverifikasi. AutomationBench menilai otomatisasi tugas yang lebih luas.
Selain itu, Artificial Analysis memberikan skor 50 pada Intelligence Index-nya. Angka ini naik 10 poin dibanding V4 Flash versi April, dan unggul 6 poin di atas V4 Pro. Skor tersebut hanya tertinggal satu poin dari GPT-5.6 Luna versi max yang mencapai 51.
Perbandingan dengan kompetitor juga menarik. Di Terminal-Bench 2.1, V4 Flash 0731 mencetak 82,7, sementara Anthropic Opus-4.8 yang memimpin di mayoritas benchmark mencapai 85,0. Selisih hanya 2,3 poin, tetapi dengan harga yang jauh lebih rendah.
Harga resmi DeepSeek V4 Flash dipecah menjadi tiga kategori: input yang tidak terkena cache, input yang terkena cache, dan output. Pembagian ini penting, terutama untuk agen yang sering mengirim ulang konteks yang sama di setiap giliran.
| Komponen | Harga per 1 juta token |
|---|---|
| Input uncached (cache miss) | $0,14 |
| Input cached (cache hit) | $0,0028 |
| Output | $0,28 |
Diskon cache hit sebesar 98 persen ini jauh lebih agresif dibanding rata-rata industri yang berada di kisaran 90 persen. Untuk beban kerja agen yang mengirim ulang riwayat percakapan, isi file, dan output tool di setiap langkah, angka ini membuat biaya operasional menjadi sangat kecil.
Sebagai perbandingan, V4 Pro berjalan di 0,025 yuan untuk input cached, 3 yuan untuk input uncached, dan 6 yuan untuk output. V4 Flash hanya sepertiga dari biaya Pro untuk input uncached dan output. Ini adalah dasar dari argumen price-performance V4 Flash.
Artificial Analysis juga mencatat bahwa Cost per Task V4 Flash 0731 sekitar 60 persen lebih rendah dibanding GPT-5.6 Luna versi max, meski keduanya memiliki tingkat kecerdasan yang sebanding. GPT-5.6 Luna baru saja memangkas harga 80 persen pada hari yang sama, namun V4 Flash tetap lebih murah.
Penting untuk dipahami bahwa angka $0,28 per juta token yang banyak diulang hanya merujuk pada output. Biaya penuh sebuah request adalah kombinasi dari ketiga kategori. Bagi agen yang mengirim ulang banyak konteks, split harga ini menjadi faktor penentu.
Salah satu perubahan terbesar pada rilis 0731 adalah penambahan protokol kabel ketiga ke API DeepSeek: dukungan native terhadap OpenAI Responses API. Bagi pengembang, ini mungkin lebih penting daripada angka benchmark mana pun.
Pengembang yang sudah membangun di ekosistem OpenAI dapat beralih ke V4 Flash dengan perubahan kode yang minimal. Alih-alih harus menulis ulang seluruh integrasi, cukup mengganti endpoint dan model identifier. Ini menurunkan hambatan adopsi secara signifikan.
Selain itu, DeepSeek juga mengadaptasi model ini untuk Codex. Ini memperluas jangkauan V4 Flash ke alur kerja coding berbasis agen yang semakin populer. Kombinasi Responses API dan dukungan Codex menjadikan V4 Flash pilihan yang praktis bagi tim pengembangan modern.
V4 Flash juga mendukung format Anthropic API dan fitur JSON output serta tool calls. Dukungan multi-protokol ini berarti tim dapat menggunakan V4 Flash di berbagai stack tanpa perubahan arsitektur yang besar.
Ada beberapa detail yang perlu diperhatikan sebelum menggunakan model ini di produksi.
Mode thinking aktif secara default. Thinking mode menyala otomatis dan ditagih dengan tarif output, meski token reasoning tersebut tidak terlihat di respons akhir. Untuk pipeline yang sensitif terhadap biaya, ini bisa menaikkan tagihan secara tidak terduga jika tidak dikelola dengan hati-hati.
Rilis API-only, tanpa bobot terbuka. Berbeda dengan rilis DeepSeek sebelumnya yang membuka bobot model seperti V3 dan V3.2, DeepSeek V4 Flash 0731 hanya tersedia melalui API. Tidak ada bobot yang dipublikasikan di Hugging Face saat rilis, dan platform masih memuat build April pada hari peluncuran.
V4 Pro tetap di preview. Flagship 1,6 triliun parameter masih dalam tahap preview. DeepSeek memilih meluncurkan varian ringan lebih dulu, sebuah keputusan yang jarang terjadi di industri.
Skor benchmark perlu verifikasi. Semua angka benchmark pada rilis ini adalah klaim DeepSeek sendiri. Belum ada evaluasi independen yang mengonfirmasi skor tersebut di lingkungan nyata.
V4 Flash 0731 tersedia melalui API DeepSeek dengan base URL https://api.deepseek.com. Untuk format OpenAI, gunakan endpoint tersebut langsung. Untuk format Anthropic, gunakan https://api.deepseek.com/anthropic.
Model juga tersedia di platform pihak ketiga seperti OpenRouter dan DeepInfra. Di OpenRouter, harga input terdaftar sebesar $0,14 per juta token dan output $0,28 per juta token, konsisten dengan harga resmi DeepSeek.
Untuk mulai menggunakan, cukup buat API key, pilih model deepseek-v4-flash, dan kirim request standar OpenAI-compatible. Karena mendukung Responses API, integrasi dengan tool dan framework yang sudah ada di ekosistem OpenAI berjalan lancar.
Sebagai praktisi yang menjalankan pipeline AI agent dengan banyak model, ada beberapa hal yang menurut saya patut disorot dari rilis ini.
Pertama, keputusan DeepSeek merilis Flash lebih dulu dibanding Pro adalah sinyal yang jelas tentang arah pasar. Industri sedang bergerak dari perlombaan skor chatbot umum menuju efisiensi agen. DeepSeek mengoptimalkan model untuk apa yang benar-benar dibayar pengembang, bukan untuk memenangkan satu benchmark tertentu.
Kedua, struktur harga yang berfokus pada cache hit adalah desain yang cerdas. Agen hampir selalu mengirim ulang konteks yang sama, jadi diskon 98 persen untuk input cached bukan sekadar gimmick pemasaran. Ini secara nyata mengubah ekonomi operasional pipeline agen, terutama untuk beban kerja yang berjalan lama dan berulang.
Ketiga, rilis API-only tanpa bobot terbuka menandai pergeseran strategis dari DeepSeek. Reputasi DeepSeek selama ini dibangun di atas model open-weight. Jika pola ini berlanjut ke V4 Pro, komunitas open-source harus mulai berpikir ulang tentang ketergantungan mereka pada DeepSeek untuk deployment lokal.
Kekhawatiran terbesar saya ada pada mode thinking yang aktif secara default dan ditagih sebagai output. Untuk pipeline yang berjalan dalam skala besar, token reasoning yang tersembunyi bisa menjadi pos biaya yang tidak terlihat. Saran saya, lakukan uji pola penggunaan nyata sebelum menerapkan di produksi.
Terlepas dari kekhawatiran itu, posisi V4 Flash 0731 sangat menarik. Model ini menawarkan skor agen yang mendekati model premium dengan biaya yang jauh lebih rendah, plus konteks 1 juta token dan dukungan multi-protokol. Untuk banyak tim, ini adalah kombinasi yang sulit ditolak.
| Aspek | V4 Flash 0731 | Opus-4.8 | GPT-5.6 Luna |
|---|---|---|---|
| Terminal-Bench 2.1 | 82,7 | 85,0 | Belum tersedia |
| Intelligence Index | 50 | Belum tersedia | 51 |
| Output per 1M token | $0,28 | Jauh lebih mahal | Sekitar 60% lebih mahal |
| Konteks | 1 juta token | Tergantung versi | Tergantung versi |
| Bobot terbuka | Tidak | Tidak | Tidak |
Untuk beban kerja agen dan coding bertenaga tinggi dengan anggaran terbatas, DeepSeek V4 Flash 0731 adalah kandidat yang sangat kuat. Skor agennya mendekati Opus-4.8 dengan selisih kecil, sementara biayanya hanya sebagian kecil.
Dukungan Responses API membuatnya mudah diadopsi bagi tim yang sudah berada di ekosistem OpenAI. Konteks 1 juta token dan output 384 ribu token juga menutup kebutuhan untuk beban kerja dokumen panjang dan alur multi-langkah.
Namun, jika kebutuhan utama adalah reasoning berat dengan chain-of-thought yang kompleks, atau ketergantungan pada model open-weight untuk deployment lokal, model ini mungkin bukan pilihan yang tepat. V4 Pro, meski masih preview, tetap menjadi opsi untuk tugas-tugas tersebut.
Kasus penggunaan yang paling cocok meliputi coding assistant, pipeline agen, otomatisasi tugas multi-langkah, analisis dokumen panjang, dan pengolahan data dalam skala besar dengan anggaran ketat.
Apakah DeepSeek V4 Flash 0731 merupakan model open-source?
Tidak. Berbeda dengan V3 dan V3.2 yang dirilis dengan bobot terbuka, V4 Flash 0731 adalah model proprietary yang hanya tersedia melalui API resmi DeepSeek atau platform partner. Bobotnya tidak dipublikasikan.
Berapa biaya menggunakan V4 Flash 0731?
Input uncached dikenakan $0,14 per juta token, input cached $0,0028 per juta token, dan output $0,28 per juta token. Diskon cache hit sebesar 98 persen menjadikannya sangat hemat untuk beban kerja agen yang mengirim ulang konteks.
Apakah V4 Flash 0731 lebih baik dari V4 Pro?
Pada benchmark agen tertentu, V4 Flash 0731 mengungguli V4 Pro Preview. Pada Artificial Analysis Intelligence Index, Flash mencetak 50 dibanding V4 Pro yang lebih rendah. Namun V4 Pro tetap menjadi pilihan untuk tugas reasoning berat dan masih dalam tahap preview.
Bagaimana cara beralih dari model OpenAI ke V4 Flash?
Karena V4 Flash mendukung Responses API secara native, perpindahan dari ekosistem OpenAI relatif mudah. Cukup ganti endpoint dan model identifier menjadi deepseek-v4-flash dengan base URL https://api.deepseek.com.
Apakah mode thinking bisa dimatikan?
Ya. V4 Flash mendukung mode non-thinking dan thinking. Mode thinking aktif secara default dan ditagih dengan tarif output. Jika ingin menghemat biaya, mode non-thinking dapat dipilih untuk tugas yang tidak membutuhkan reasoning mendalam.
DeepSeek V4 Flash 0731 adalah rilis yang signifikan karena beberapa alasan. Pertama, ia membuktikan bahwa model kecil dengan arsitektur efisien bisa bersaing dengan model premium pada tugas agen. Kedua, struktur harganya dirancang khusus untuk ekonomi agen modern. Ketiga, keputusan rilis API-only menjadi tanda bahwa DeepSeek mulai mengubah model bisnisnya.
Jika sedang mengevaluasi model untuk pipeline agen atau coding assistant, V4 Flash 0731 layak masuk daftar uji. Mulailah dengan menguji skenario nyata, perhatikan tagihan thinking mode, dan bandingkan langsung dengan model yang sedang dipakai. Keputusan akhir tetap bergantung pada pola penggunaan spesifik.