Baru saja, OpenAI merilis GPT-Images-2.5:
Latensi generasi berkurang hingga setengahnya, akurasi penyuntingan meningkat, fitur input tangan bebas Sketch ditambahkan, dan model cepat-lambat pertama kali dipisahkan di sisi API.

https://x.com/OpenAI/status/2097394956457623964
Dibuka untuk semua pengguna ChatGPT, ChatGPT Work, dan Codex, termasuk versi gratis.
Dengan perhitungan angka ini, sekitar 430 juta gambar per hari melewati sistem ini, dan peningkatan kecepatan generasi dirasakan jauh lebih luas daripada iterasi fitur biasa.
OpenAI mengumumkan total generasi ChatGPT Images dan GPT-Image API: 3 miliar gambar per minggu.
Demo yang menakjubkan: Masalah kode bahasa Tiongkok yang acak sudah tidak ada lagi
Seberapa kuat GPT-Image-2.5? Mari kita lihat langsung Demo-nya.
Kode bahasa Tiongkok yang acak telah hilang!

Ini adalah gambar referensi:

Ini adalah gambar retro yang dikeluarkan:

Apakah Anda masih bisa membedakan foto asli dan gambar yang dihasilkan AI?
Mengambil foto cetak lama dan mengubahnya menjadi foto digital高清 adalah hal yang sangat mudah.

Ingin mencoba efek visual pakaian baru? Serahkan saja ke ChatGPT:
Masukkan:

Output:

Masukkan gambar asli, selimut berantakan:

Mengeluarkan gambar selimut yang dilipat rapi:

Konsistensi adegan sangat kuat, tidak terlihat ada kekeliruan.
Lebih cepat setengahnya, sudah diperbaiki agar tidak berantakan
Peningkatan kecepatan paling langsung. Angka yang diberikan OpenAI menunjukkan penurunan latensi generasi hingga 50% dibandingkan Images 2.0.
Kualitas rendering cahaya dan tekstur diperbaiki sekaligus, dengan tingkat akurasi reproduksi subjek manusia dalam foto referensi yang lebih tinggi.
Pengeditan presisi menangani masalah lama pada alat generasi gambar: pengguna meminta perubahan sebagian, tetapi model mengubah bagian yang seharusnya tidak diubah.
Menurut OpenAI, Images 2.5 dapat mengubah hanya area yang ditentukan, sambil mempertahankan komposisi, pencahayaan, dan fitur subjek dari elemen lain dalam gambar, dengan peningkatan stabilitas yang jelas pada latar belakang kompleks dan adegan dengan banyak subjek.
Pengguna juga dapat langsung menambahkan komentar dan penanda pada gambar, serta menandai area yang perlu diubah, dengan logika operasi yang mirip dengan alat desain Figma.

Konsistensi dalam pengeditan berulang adalah perbaikan ketiga.
Saat mengedit gambar yang sama berulang kali dalam percakapan panjang, hasil edit dari beberapa putaran pertama tetap terjaga, dan kualitas gambar tidak menurun seiring bertambahnya putaran.

Produk Higgsfield AI, Axultan Alimkulov, menilai Flare:
Yang paling kami kagumi adalah pemahamannya terhadap "apa yang seharusnya tidak diubah".
Lakukan penyuntingan yang bermakna tanpa menghilangkan karakter, komposisi, dan gaya visual gambar aslinya.

Sketch dan template: Dari mengetik ke menggambar
Di tingkat produk, Images 2.5 membawa empat fitur baru.
Masuk ke Sketch dilakukan dengan memasukkan @Sketch di kotak percakapan ChatGPT, lalu membuka panel sketsa. Pengguna menggambar satu sketsa, dilengkapi dengan deskripsi teks mengenai gaya dan detailnya, lalu ChatGPT menghasilkan gambar akhir berdasarkan sketsa sebagai referensi komposisi.
Contoh yang diberikan OpenAI mencakup sketsa tata letak ruangan yang diubah menjadi render desain interior, dan sketsa siluet tokoh yang diubah menjadi ilustrasi. Ambang batasnya bukan pada keterampilan menggambar, tetapi pada kemampuan menggambarkan hubungan spasial dan proporsi kasar agar model dapat memahami struktur gambar.
Template mencakup format-format frekuensi tinggi seperti poster, gambar produk, dan brosur.
Pilih satu template, masukkan informasi dan preferensi gaya, model akan menghasilkan gambar sesuai struktur yang telah ditentukan, menghemat waktu percobaan dan kesalahan dalam menulis Prompt dari awal.
Prompt bagikan agar pengguna dapat membagikan Prompt lengkap yang telah dihasilkan, sehingga orang lain dapat memasukkan foto dan detail mereka sendiri untuk menghasilkan versi pribadi dalam kerangka yang sama.
Sebuah Prompt "potret retro tahun 80-an" telah beredar di platform sosial, pengguna dapat mengunggah foto diri mereka untuk mendapatkan foto dengan gaya yang sama.

Empat fitur menuju perubahan yang sama: proses mengubah gambar di pikiran menjadi gambar nyata, tidak lagi bergantung hanya pada pengetikan!
Flare dan Sunburst: API Pertama Kali Dibagi Dua
Untuk pengembang, OpenAI secara bersamaan meluncurkan dua model gambar di API: GPT-Image-2.5 Flare dan GPT-Image-2.5 Sunburst.
Flare menonjolkan kecepatan dan pembuatan massal, dengan OpenAI menempatkannya sebagai pilihan default untuk sebagian besar aplikasi.
Cocok untuk skenario seperti konten sosial, gambar pengalaman produk, prototipe cepat, dan gambar dengan frekuensi tinggi.
Data dari Lucky Liao dari tim evaluasi Manus lebih spesifik: Flare mencapai kecepatan output gambar 2 hingga 4 kali lebih cepat daripada GPT-Image-2 dalam pengujian mereka, dan peningkatan dalam pembuatan latar belakang transparan secara langsung bermanfaat untuk generasi programatis bahan merek, presentasi, dan gambar halaman web.

Sunburst dirancang untuk alur kerja kreatif高端, menukar waktu generasi yang lebih panjang demi kontrol penyuntingan yang lebih halus.
Skenario khas yang diberikan OpenAI adalah bahan siap pakai untuk pemasaran merek dan gambar produk yang telah disempurnakan.
Adobe telah mengonfirmasi integrasi model Images 2.5 ke dalam Firefly.
Matt Chotin, Direktur Senior Produk Adobe, mengatakan bahwa versi 2.5 membawa kecepatan generasi yang lebih cepat dan konsistensi resolusi, sehingga gambar tetap tajam dan realistis setelah beberapa kali penyempurnaan.

Pemisahan dua model tersebut sesuai dengan dua kebutuhan: frekuensi tinggi dan latensi rendah, serta kustomisasi akurasi tinggi.
Flare memberikan skenario untuk volume tinggi, Sunburst memberikan skenario untuk kualitas tinggi, pengembang dapat memilih berdasarkan kebutuhan bisnis tanpa harus menunggu akurasi yang tidak diperlukan.
Ini adalah pertama kalinya OpenAI Image API melakukan pelapisan produk berdasarkan kecepatan dan kualitas, dengan logika yang selaras dengan pelapisan API model bahasa.
Penamaan Images 2.5 melanjutkan ritme lini produk gambar OpenAI: arsitektur tetap sama, kecepatan dan akurasi meningkat terlebih dahulu.
GPT-Image-1.5 pada akhir 2024 menggunakan pola yang sama.
Dua rilis versi 0.5 terjadi dalam waktu kurang dari satu tahun, frekuensi iterasi model gambar kini sejajar dengan model bahasa.
Ini adalah model generasi gambar terkuat di dunia, unggul jauh.
Kemampuan multimodal OpenAI yang terus ditingkatkan kemungkinan besar merupakan respons terhadap model Anthropic, dengan memperkuat kemampuan termasuk Computer-Use, sehingga meningkatkan model dasar seperti GPT-7.
Referensi:
https://openai.com/index/introducing-chatgpt-images-2-5/
Artikel ini berasal dari akun WeChat "Sinzhiyuan" (ID: AI_era), penulis: ASI Revelation, editor: Marco
