API V4 Flash Vision DeepSeek Berguna—dan Masih Eksperimental
DeepSeek telah menambahkan input gambar ke lini API cepatnya, tetapi pratinjau ini belum membuktikan performa yang andal pada screenshot, bagan, dan dokumen.
DeepSeek menambahkan input gambar ke API-nya melalui model eksperimental deepseek-v4-flash-vision-exp. Model ini menerima screenshot, bagan, dan dokumen melalui antarmuka JSON, Responses, dan yang kompatibel dengan Anthropic. Itu membuatnya mudah dipanggil, tetapi bukan berarti model ini siap menggantikan jalur visi produksi.
Langkah pertama yang tepat adalah uji coba yang mengutamakan kegagalan: bekukan sekumpulan kecil gambar jinak dan grader khusus tugas, kirim permintaan berbatas, catat penggunaan token dan status aktual dari API, serta pertahankan workflow yang ada sebagai fallback sampai model eksperimental melewati gate kualitas, keandalan, latensi, dan biaya yang eksplisit.
Tidak ada pemanggilan endpoint untuk artikel ini, jadi artikel ini tidak melaporkan hasil baru tentang tingkat keberhasilan, latensi, atau biaya. Protokol di bawah dirancang untuk menghasilkan pengukuran tersebut tanpa mengacaukan klaim vendor atau demo yang berhasil dengan bukti produksi.
Apa yang dirilis DeepSeek—dan apa yang belum terbukti
Dalam pembaruan API 21 Agustus, DeepSeek menyebut DeepSeek-V4-Flash-Vision-Exp sebagai model eksperimental dan mengatakan performa pure-text-nya setara dengan V4 Flash biasa. Perusahaan juga mengatakan kemampuan visual-agent-nya mendekati Claude Opus 4.8. Itu adalah perbandingan vendor, bukan hasil yang direproduksi secara independen untuk artikel ini.
SiliconANGLE melaporkan bahwa model ini tersedia melalui platform developer berbayar DeepSeek dan mencatat perusahaan belum mengungkapkan detail arsitektur. Karena itu, bukti yang tersedia menetapkan API eksperimental yang aktif dan perilakunya yang terdokumentasi—bukan seberapa akurat atau andal model ini menangani workload produksi tertentu.
Halaman harga saat ini mencantumkan context window satu juta token dan output maksimum 384.000 token. Model ini mendukung output JSON dan pemanggilan tool di seluruh API JSON, Responses, dan yang kompatibel dengan Anthropic. Limit yang besar adalah plafon kapasitas, bukan default uji coba yang masuk akal. Mulailah dengan limit output dan kumpulan gambar terkecil yang diperlukan tugas.
Pilihan transport mengubah bukti
Panduan visi mendokumentasikan tiga cara mengirim gambar. Ketiganya berbeda dalam ukuran permintaan, mode kegagalan, dan kelayakan untuk digunakan ulang.
| Transport | Batas yang didokumentasikan | Gunakan ketika | Kegagalan yang perlu dimasukkan dalam uji coba |
|---|---|---|---|
| Data URL Base64 | 32 MiB per gambar; seluruh body permintaan dibatasi 48 MiB | Gambar kecil dan harus dikirim dalam satu permintaan | Encoding tidak valid, klaim media salah, dan body melebihi batas |
| URL gambar publik | URL hingga 8.192 karakter; gambar 32 MiB; unduhan harus selesai dalam 60 detik | Sumber bersifat publik, stabil, dan aman untuk diambil DeepSeek | Link kedaluwarsa, loop redirect, origin lambat, dan respons bukan gambar |
Files API file_id | Gambar hingga 64 MiB; total permintaan dapat mencapai 200 MiB ketika file ID disertakan | Artefak yang sama dan telah disetujui akan digunakan ulang atau terlalu besar untuk di-inline | Referensi hilang, kedaluwarsa, tidak diotorisasi, atau mengarah ke file yang salah |
JPEG, PNG, GIF, dan WebP didukung, dan layanan memeriksa isi aktual alih-alih mempercayai nama file. Gambar harus berada di pesan pengguna; menaruhnya di pesan sistem atau asisten menghasilkan respons 400. Sebuah permintaan dapat berisi hingga 600 gambar, tetapi batas dimensi per sisi turun dari 8.192 piksel menjadi 4.096 jika permintaan berisi 15 gambar atau lebih. Uji coba harus menguji jumlah produksi yang dituju, bukan jumlah maksimum yang diiklankan.
Untuk endpoint yang kompatibel dengan Anthropic, referensi file memerlukan header anthropic-beta: files-api-2025-04-14 yang didokumentasikan. Dalam Responses API, transport base64, URL, dan file yang sama tersedia melalui input_image. Pertahankan interface dan transport dalam setiap catatan run; keduanya adalah bagian dari sistem yang diuji.
Detail gambar mengubah bukti dan biaya sekaligus
Pengaturan detail bukan kosmetik. low mengecilkan gambar menjadi 512 × 512 piksel, yang dapat membuat adegan atau layout luas lebih murah tetapi menghapus label kecil. original mempertahankan gambar sumber; high saat ini merupakan alias kompatibilitas untuknya. auto saat ini berperilaku seperti original, sehingga mengandalkan auto membuat perubahan sisi layanan di masa depan lebih sulit dideteksi.
DeepSeek mengatakan mereka secara otomatis memperbesar gambar kecil dan menyesuaikan gambar yang lebih besar menuju sekitar 800 × 800 piksel total sambil mempertahankan rasio aspek. Batas atas yang didokumentasikan adalah 384 token per gambar, tetapi jumlah aktual dapat berubah. Gunakan usage yang dikembalikan bersama setiap respons sebagai catatan penagihan, bukan perkiraan dari ukuran file atau dimensi piksel.
Harga daftar saat ini per satu juta token adalah:
| Kelas token | Di luar jam sibuk | Jam sibuk |
|---|---|---|
| Input yang di-cache | $0.007 | $0.014 |
| Input tanpa cache | $0.22 | $0.44 |
| Output | $0.66 | $1.32 |
Jam sibuk saat ini adalah 01:00–04:00 dan 06:00–10:00 UTC. Harga dapat berubah, jadi simpan jadwal harga dan timestamp bukti di samping run. Untuk setiap percobaan, hitung:
attempt cost = cached input × cache rate + uncached input × input rate + output × output rate
Bagi jumlah token dengan satu juta saat menerapkan tarif tersebut. Kemudian bagi biaya semua percobaan pertama dan retry dengan tugas yang diterima. Respons murah yang gagal menyelesaikan tugas bukanlah tugas selesai yang murah.
Pratinjau membuktikan akses, bukan kesiapan produk
DeepSeek telah membuka permukaan eksperimental yang berguna: developer dapat mengirim gambar melalui API yang familier dan mengamati model yang menggabungkan visi dengan penalaran teks. Pengumuman dan dokumentasi tidak menetapkan akurasi pada screenshot, bagan, dokumen, atau kasus kegagalan yang penting bagi produk tertentu.
Pilihan transport dan pengaturan detail gambar juga mengubah apa yang diterima model dan biaya permintaan. Karena itu, demo yang berhasil dapat mencerminkan gambar yang mudah, prapemrosesan yang longgar, atau output yang sempit, bukan sistem visual yang umumnya andal.
Bukti independen terpenting yang belum ada adalah evaluasi tingkat tugas lintas revisi pratinjau. Sampai evaluasi itu tersedia, DeepSeek V4 Flash Vision Exp paling baik dipahami sebagai arah perkembangan: kemampuan multimodal memasuki lini API cepat, tetapi label eksperimental masih menggambarkan kontrak keandalannya.