DeepSeek V4 Pro mencatat lonjakan paling mencolok pada pengujian DeepSWE, dengan skor 62,7 poin dari sebelumnya 12,8 poin pada versi Preview. Peningkatan tersebut menempatkan model ini sebagai salah satu perhatian baru dalam persaingan model untuk pekerjaan agen AI.
Data yang dibagikan DeepSeek juga menunjukkan V4 Pro unggul tipis atas Kimi K3 pada dua pengujian yang membandingkan keduanya secara langsung. Pada AutomationBench (Public), selisihnya mencapai satu poin, sedangkan pada DSBench-Hard selisihnya 4,2 poin.
Hasil pengujian yang dibagikan DeepSeek
Angka-angka berikut berasal dari benchmark yang dirilis DeepSeek dan mencerminkan skenario pengujian yang digunakan perusahaan. Hasil tersebut dapat menjadi gambaran kemampuan model, tetapi tidak otomatis mewakili seluruh penggunaan di lingkungan kerja nyata.
| Benchmark | DeepSeek V4 Pro | V4 Pro Preview | Kimi K3 |
|---|---|---|---|
| Terminal-Bench 2.1 | 87,9 | 72,1 | – |
| DeepSWE | 62,7 | 12,8 | – |
| CyberGym | 83,3 | 52,7 | – |
| Toolathlon-Verified | 74,1 | 55,9 | – |
| AutomationBench (Public) | 31,8 | – | 30,8 |
| DSBench-Hard | 67,2 | – | 63,0 |
Pada Terminal-Bench 2.1, DeepSeek V4 Pro meraih 87,9 poin, naik dari 72,1 poin pada model Preview. Model ini juga membukukan 83,3 poin di CyberGym, sementara versi sebelumnya memperoleh 52,7 poin.
Toolathlon-Verified memperlihatkan skor 74,1 poin untuk V4 Pro, lebih tinggi dari 55,9 poin sebelumnya. Sementara itu, Kimi K3 dari Moonshot meraih 30,8 poin pada AutomationBench (Public) dan 63,0 poin pada DSBench-Hard.
Dirancang untuk pekerjaan berlapis
DeepSeek memosisikan V4 Pro untuk menangani tugas kompleks yang membutuhkan penggunaan alat, penalaran lebih panjang, serta rangkaian tindakan yang tidak selalu sederhana. Cakupan pekerjaannya meliputi terminal, rekayasa perangkat lunak, keamanan siber, dan penggunaan alat secara kompleks.
Agen AI merupakan sistem yang ditujukan untuk membantu menjalankan serangkaian tugas dengan tingkat kemandirian lebih tinggi. Dalam konteks ini, kemampuan mengolah instruksi, memakai alat, dan meneruskan langkah kerja menjadi bagian penting dari performa model.
V4 Pro menyediakan pilihan tingkat reasoning effort berupa low, high, dan max. Mode low ditujukan bagi tugas sederhana, sedangkan high untuk pekerjaan agen AI sehari-hari dan max untuk tugas yang lebih rumit.
Pengaturan serupa juga tersedia pada DeepSeek V4 Flash. Kedua model itu mendukung API OpenAI Responses secara native, dengan dukungan yang disebut dioptimalkan untuk penggunaan bersama Codex melalui pengaturan satu klik.
Tarif berbeda menurut waktu penggunaan
DeepSeek V4 Pro tersedia melalui aplikasi dan situs DeepSeek dengan pilihan “Expert Mode”. Model ini juga dapat digunakan lewat API tanpa pengguna harus mengganti nama model pada integrasi yang telah dibuat.
Mulai 16 Agustus 2026 pukul 23.00 WIB, DeepSeek menerapkan tarif peak dan off-peak. Waktu peak berlangsung pukul 08.00-11.00 WIB serta 13.00-17.00 WIB, sementara tarif off-peak disebut 50 persen lebih murah.
| Model | Input Cache Hit | Input Cache Miss | Output |
|---|---|---|---|
| DeepSeek V4 Flash | 0,014 dollar AS | 0,44 dollar AS | 1,32 dollar AS |
| DeepSeek V4 Pro | 0,044 dollar AS | 1,32 dollar AS | 3,96 dollar AS |
Tarif peak V4 Pro tercatat 0,044 dollar AS untuk input cache hit, 1,32 dollar AS untuk input cache miss, dan 3,96 dollar AS untuk output per 1 juta token. Skema ini membuat waktu penggunaan menjadi salah satu pertimbangan bagi pengguna API yang menjalankan beban kerja agen AI secara intensif.






