API V4 Flash Vision DeepSeek Berguna—dan Masih Eksperimental

DeepSeek telah menambahkan input gambar ke lini API cepatnya, tetapi pratinjau ini belum membuktikan performa yang andal pada screenshot, bagan, dan dokumen.

Bagikan artikel ini

DeepSeek menambahkan input gambar ke API-nya melalui model eksperimental deepseek-v4-flash-vision-exp. Model ini menerima screenshot, bagan, dan dokumen melalui antarmuka JSON, Responses, dan yang kompatibel dengan Anthropic. Itu membuatnya mudah dipanggil, tetapi bukan berarti model ini siap menggantikan jalur visi produksi.

Langkah pertama yang tepat adalah uji coba yang mengutamakan kegagalan: bekukan sekumpulan kecil gambar jinak dan grader khusus tugas, kirim permintaan berbatas, catat penggunaan token dan status aktual dari API, serta pertahankan workflow yang ada sebagai fallback sampai model eksperimental melewati gate kualitas, keandalan, latensi, dan biaya yang eksplisit.

Tidak ada pemanggilan endpoint untuk artikel ini, jadi artikel ini tidak melaporkan hasil baru tentang tingkat keberhasilan, latensi, atau biaya. Protokol di bawah dirancang untuk menghasilkan pengukuran tersebut tanpa mengacaukan klaim vendor atau demo yang berhasil dengan bukti produksi.

Apa yang dirilis DeepSeek—dan apa yang belum terbukti

Dalam pembaruan API 21 Agustus, DeepSeek menyebut DeepSeek-V4-Flash-Vision-Exp sebagai model eksperimental dan mengatakan performa pure-text-nya setara dengan V4 Flash biasa. Perusahaan juga mengatakan kemampuan visual-agent-nya mendekati Claude Opus 4.8. Itu adalah perbandingan vendor, bukan hasil yang direproduksi secara independen untuk artikel ini.

SiliconANGLE melaporkan bahwa model ini tersedia melalui platform developer berbayar DeepSeek dan mencatat perusahaan belum mengungkapkan detail arsitektur. Karena itu, bukti yang tersedia menetapkan API eksperimental yang aktif dan perilakunya yang terdokumentasi—bukan seberapa akurat atau andal model ini menangani workload produksi tertentu.

Halaman harga saat ini mencantumkan context window satu juta token dan output maksimum 384.000 token. Model ini mendukung output JSON dan pemanggilan tool di seluruh API JSON, Responses, dan yang kompatibel dengan Anthropic. Limit yang besar adalah plafon kapasitas, bukan default uji coba yang masuk akal. Mulailah dengan limit output dan kumpulan gambar terkecil yang diperlukan tugas.

Pilihan transport mengubah bukti

Panduan visi mendokumentasikan tiga cara mengirim gambar. Ketiganya berbeda dalam ukuran permintaan, mode kegagalan, dan kelayakan untuk digunakan ulang.

Pilihan transport gambar DeepSeek V4 Flash Vision Exp

TransportBatas yang didokumentasikanGunakan ketikaKegagalan yang perlu dimasukkan dalam uji coba
Data URL Base6432 MiB per gambar; seluruh body permintaan dibatasi 48 MiBGambar kecil dan harus dikirim dalam satu permintaanEncoding tidak valid, klaim media salah, dan body melebihi batas
URL gambar publik

URL hingga 8.192 karakter; gambar 32 MiB; unduhan harus selesai dalam 60 detik

Sumber bersifat publik, stabil, dan aman untuk diambil DeepSeek

Link kedaluwarsa, loop redirect, origin lambat, dan respons bukan gambar

Files API file_id

Gambar hingga 64 MiB; total permintaan dapat mencapai 200 MiB ketika file ID disertakan

Artefak yang sama dan telah disetujui akan digunakan ulang atau terlalu besar untuk di-inline

Referensi hilang, kedaluwarsa, tidak diotorisasi, atau mengarah ke file yang salah

JPEG, PNG, GIF, dan WebP didukung, dan layanan memeriksa isi aktual alih-alih mempercayai nama file. Gambar harus berada di pesan pengguna; menaruhnya di pesan sistem atau asisten menghasilkan respons 400. Sebuah permintaan dapat berisi hingga 600 gambar, tetapi batas dimensi per sisi turun dari 8.192 piksel menjadi 4.096 jika permintaan berisi 15 gambar atau lebih. Uji coba harus menguji jumlah produksi yang dituju, bukan jumlah maksimum yang diiklankan.

Untuk endpoint yang kompatibel dengan Anthropic, referensi file memerlukan header anthropic-beta: files-api-2025-04-14 yang didokumentasikan. Dalam Responses API, transport base64, URL, dan file yang sama tersedia melalui input_image. Pertahankan interface dan transport dalam setiap catatan run; keduanya adalah bagian dari sistem yang diuji.

Detail gambar mengubah bukti dan biaya sekaligus

Pengaturan detail bukan kosmetik. low mengecilkan gambar menjadi 512 × 512 piksel, yang dapat membuat adegan atau layout luas lebih murah tetapi menghapus label kecil. original mempertahankan gambar sumber; high saat ini merupakan alias kompatibilitas untuknya. auto saat ini berperilaku seperti original, sehingga mengandalkan auto membuat perubahan sisi layanan di masa depan lebih sulit dideteksi.

DeepSeek mengatakan mereka secara otomatis memperbesar gambar kecil dan menyesuaikan gambar yang lebih besar menuju sekitar 800 × 800 piksel total sambil mempertahankan rasio aspek. Batas atas yang didokumentasikan adalah 384 token per gambar, tetapi jumlah aktual dapat berubah. Gunakan usage yang dikembalikan bersama setiap respons sebagai catatan penagihan, bukan perkiraan dari ukuran file atau dimensi piksel.

Harga daftar saat ini per satu juta token adalah:

Harga token DeepSeek V4 Flash Vision Exp yang diperbarui pada 22 Agustus 2026

Kelas tokenDi luar jam sibukJam sibuk
Input yang di-cache$0.007$0.014
Input tanpa cache$0.22$0.44
Output$0.66$1.32

Jam sibuk saat ini adalah 01:00–04:00 dan 06:00–10:00 UTC. Harga dapat berubah, jadi simpan jadwal harga dan timestamp bukti di samping run. Untuk setiap percobaan, hitung:

attempt cost = cached input × cache rate + uncached input × input rate + output × output rate

Bagi jumlah token dengan satu juta saat menerapkan tarif tersebut. Kemudian bagi biaya semua percobaan pertama dan retry dengan tugas yang diterima. Respons murah yang gagal menyelesaikan tugas bukanlah tugas selesai yang murah.

Pratinjau membuktikan akses, bukan kesiapan produk

DeepSeek telah membuka permukaan eksperimental yang berguna: developer dapat mengirim gambar melalui API yang familier dan mengamati model yang menggabungkan visi dengan penalaran teks. Pengumuman dan dokumentasi tidak menetapkan akurasi pada screenshot, bagan, dokumen, atau kasus kegagalan yang penting bagi produk tertentu.

Pilihan transport dan pengaturan detail gambar juga mengubah apa yang diterima model dan biaya permintaan. Karena itu, demo yang berhasil dapat mencerminkan gambar yang mudah, prapemrosesan yang longgar, atau output yang sempit, bukan sistem visual yang umumnya andal.

Bukti independen terpenting yang belum ada adalah evaluasi tingkat tugas lintas revisi pratinjau. Sampai evaluasi itu tersedia, DeepSeek V4 Flash Vision Exp paling baik dipahami sebagai arah perkembangan: kemampuan multimodal memasuki lini API cepat, tetapi label eksperimental masih menggambarkan kontrak keandalannya.

Sumber

  1. DeepSeek API updates
  2. DeepSeek vision guide
  3. DeepSeek API pricing
  4. DeepSeek API error codes
  5. DeepSeek API rate limits
  6. SiliconANGLE report on DeepSeek V4 Flash Vision Exp