Baru sahaja, OpenAI melancarkan GPT-Images-2.5:
Keterlambatan penghasilan berkurang sehingga separuhnya, ketepatan penyuntingan ditingkatkan, fungsi input lukisan tangan Sketch ditambahkan, dan model laju dan perlahan pertama kali dipisahkan di sisi API.

https://x.com/OpenAI/status/2097394956457623964
Dibuka kepada semua pengguna ChatGPT, ChatGPT Work, dan Codex, termasuk versi percuma.
Berdasarkan nombor ini, sekitar 430 juta gambar sehari diproses melalui sistem ini, dan kesan pengoptimuman kelajuan penghasilan meliputi jangkauan yang jauh melebihi peningkatan fungsi biasa.
OpenAI mengumumkan jumlah penghasilan gabungan ChatGPT Images dan GPT-Image API: 3 miliar gambar seminggu.
Demo yang menakjubkan: Masalah kod bahasa Cina telah diatasi
Seberapa kuatkah GPT-Image-2.5? Mari kita lihat Demo secara langsung.
Masalah kod bahasa Cina telah hilang!

Ini adalah gambar rujukan:

Ini adalah gambar retro yang dikeluarkan:

Bolehkah anda masih membezakan gambar asli dan gambar yang dihasilkan AI?
Mengambil dan menyesuaikan gambar cetak lama menjadi gambar elektronik berkualiti tinggi adalah perkara yang mudah.

Ingin mencuba kesan visual pakaian yang berbeza? Serahkan saja kepada ChatGPT:
Masukkan:

Output:

Masukkan gambar asal, selimut berantakan:

Mengeluarkan gambar selimut yang dilipat dengan rapi:

Konsistensi adegan sangat tinggi, tiada tanda kebocoran.
Lebih cepat separuh, diubah tidak kacau
Peningkatan kelajuan paling langsung. Nombor yang diberikan oleh OpenAI ialah penurunan tundaan penghasilan sehingga 50% berbanding Images 2.0.
Kualiti render cahaya dan tekstur diperbaiki serentak, dengan ketepatan pengembalian subjek manusia dalam gambar rujukan yang lebih tinggi.
Pengeditan tepat menangani masalah lama pada alat penghasil gambar: pengguna meminta perubahan pada bahagian tertentu, tetapi model mengubah bahagian yang tidak diminta untuk diubah juga.
Menurut OpenAI, Images 2.5 boleh mengubah kawasan yang ditentukan sahaja, sambil mengekalkan komposisi, pencahayaan, dan ciri-ciri subjek bagi elemen-elemen lain dalam gambar, dengan peningkatan kestabilan yang jelas dalam adegan latar belakang yang kompleks dan berbilang subjek.
Pengguna juga boleh meletakkan komen dan tanda pada gambar secara langsung, menandakan tempat yang perlu diubah, dengan logik operasi yang serupa dengan alat reka bentuk Figma.

Konsistensi dalam penyuntingan berbilang langkah adalah peningkatan ketiga.
Semasa mengedit gambar yang sama berulang kali dalam perbualan panjang, hasil pengeditan pada beberapa putaran pertama akan kekal, dan kualiti gambar tidak akan menurun seiring bilangan putaran.

Pengurus produk Higgsfield AI, Axultan Alimkulov, menilai Flare:
Yang paling kita kesan ialah pemahamannya terhadap "apa yang tidak perlu diubah".
Lakukan satu suntingan yang bermakna, tanpa kehilangan watak, komposisi, dan gaya visual asal.

Sketch dan templat: Dari menaip ke melukis
Di peringkat produk, Images 2.5 membawa empat fungsi baru.
Akses Sketch dilakukan dengan memasukkan @Sketch di kotak perbualan ChatGPT untuk membuka panel lukisan tangan. Pengguna melukis satu sketsa, disertai dengan huraian teks mengenai gaya dan butiran, dan ChatGPT akan menghasilkan gambar akhir berdasarkan sketsa tersebut sebagai rujukan komposisi.
Contoh yang diberikan oleh OpenAI termasuk sketsa susunan ruangan yang diubah menjadi render reka bentuk dalaman, dan sketsa siluet orang yang diubah menjadi ilustrasi. Penghalang bukan terletak pada kemahiran melukis, tetapi pada keupayaan untuk menggambarkan hubungan ruang dan nisbah kasar, supaya model memahami struktur gambar.
Templat ini mencakup format berfrekuensi tinggi seperti poster, gambar produk, dan flyer.
Pilih satu templat, masukkan maklumat dan preferensi gaya, model akan menghasilkan gambar mengikut struktur yang telah ditetapkan, mengelakkan percubaan dan kesilapan dalam menulis Prompt dari awal.
Kongsi Prompt agar pengguna membagikan Prompt penuh yang telah dihasilkan, membolehkan orang lain memasukkan foto dan butiran mereka sendiri untuk menghasilkan versi peribadi dalam kerangka yang sama.
Sebuah Prompt "potret retro tahun 80-an" telah tersebar di platform sosial, pengguna boleh muat naik swafoto untuk mendapatkan gambar dengan gaya yang sama.

Empat fungsi menunjuk kepada perubahan yang sama: proses mengubah gambar dalam fikiran menjadi gambar, tidak lagi bergantung hanya pada pengetikan!
Flare dan Sunburst: API pertama kali dibahagikan
Untuk pembangun, OpenAI secara serentak melancarkan dua model imej di API: GPT-Image-2.5 Flare dan GPT-Image-2.5 Sunburst.
Flare menekankan kelajuan dan penghasilan berbilang, dengan OpenAI menempatkannya sebagai pilihan lalai untuk kebanyakan aplikasi.
Skenario penggunaan termasuk kandungan sosial, gambar pengalaman produk, prototip pantas, dan pengeluaran gambar berfrekuensi tinggi.
Data yang diberikan oleh Lucky Liao daripada pasukan ulasan Manus lebih spesifik: Flare mencapai kelajuan pengeluaran gambar 2 hingga 4 kali ganda GPT-Image-2 dalam ujian mereka, dan peningkatan dalam penghasilan latar belakang telus secara langsung berguna untuk penghasilan bahan jenama, persembahan, dan gambar laman web secara berprogram.

Sunburst menargetkan alur kerja kreatif高端, menukar masa penghasilan yang lebih panjang untuk kawalan penyuntingan yang lebih halus.
Skenario khas yang diberikan oleh OpenAI ialah bahan siap pakai untuk pemasaran jenama dan gambar produk yang telah disempurnakan.
Adobe telah mengesahkan pengintegrasian model Images 2.5 ke dalam Firefly.
Matt Chotin, Pengarah Tinggi Produk Adobe, mengatakan bahawa versi 2.5 membawa kelajuan penghasilan yang lebih pantas dan konsistensi resolusi, di mana gambar tetap tajam dan realistik selepas beberapa putaran penyempurnaan.

Pemisahan dua model ini sesuai dengan dua keperluan: frekuensi tinggi dan latensi rendah, serta penyesuaian ketepatan tinggi.
Flare memberikan skenario untuk volum tinggi, Sunburst memberikan skenario untuk kualiti terpilih, pembangun boleh memilih berdasarkan keperluan perniagaan tanpa perlu menunggu ketepatan yang tidak diperlukan.
Ini adalah pertama kalinya OpenAI Image API mengklasifikasikan produk berdasarkan kelajuan dan kualiti, dengan logik yang selari dengan klasifikasi API model bahasa.
Penamaan Images 2.5 meneruskan ritme rangkaian produk gambar OpenAI: arsitektur tidak berubah, kecepatan dan ketepatan meningkat terlebih dahulu.
GPT-Image-1.5 pada akhir 2024 menggunakan pendekatan yang sama.
Dua versi 0.5 berjarak kurang dari setahun, frekuensi pengembangan model gambar semakin menyerupai model bahasa.
Ini adalah model penghasil gambar terkuat di dunia, memimpin dengan jarak yang sangat jauh.
Kemampuan multimodal OpenAI yang terus diperkuat kemungkinan besar merupakan respons terhadap model Anthropic, dengan memperkuat kemampuan termasuk Penggunaan Komputer, untuk meningkatkan model dasar seperti GPT-7.
Rujukan:
https://openai.com/index/mengenalkan-chatgpt-images-2-5/
Artikel ini berasal daripada akaun微信公众号 "Xin Zhi Yuan" (ID: AI_era), penulis: ASI Revelation, penyunting: Marco
