Kasalukuyang, inilabas ni OpenAI ang GPT-Images-2.5:
Nabawasan ng hanggang kalahati ang latency sa pagbuo, napabuti ang pagkakatumpak sa pag-edit, idinagdag ang bagong tampok ng pagsulat sa pamamagitan ng Sketch, at unang hihiwalay ang dalawang antas ng modelong mabilis at mabagal sa API.

https://x.com/OpenAI/status/2097394956457623964
Buksan para sa lahat ng mga user ng ChatGPT, ChatGPT Work, at Codex, kabilang ang libreng bersyon.
Batay sa numerong ito, araw-araw ay humahantong sa halos 430 milyong mga larawan ang proseso ng sistema, at ang pagtaas ng bilis ng pagbuo ay may mas malawak na epekto kaysa sa karaniwang pag-update ng mga tampok.
Ipinahayag ng OpenAI ang kabuuang paggawa ng ChatGPT Images at GPT-Image API: 3 bilyong larawan kada linggo.
Demo na nakakapagtaka: Wala nang mga kakaibang karakter sa Chinese
Gaano kalakas ang GPT-Image-2.5? Tignan natin ang Demo nang direkta.
Ang mga kakaibang karakter sa Chinese ay nawala na!

Ito ang reference na larawan:

Ito ang output ng retro image:

Maaari pa ba mong masabing kung ano ang totoong larawan at AI-generated image?
Ang pagkuha at pagpapalawig ng mga nakaprint na litrato sa mataas na kalidad na digital na larawan ay simpleng gawain.

Gusto mo bang subukan ang visual effect ng pagbabago ng damit? Iwanan mo na lang sa ChatGPT:
Input:

Output:

I-input ang orihinal na larawan, ang kumot ay kakaibang kalagayan:

I-output ang larawan ng maayos na napapalipat na kumot:

Sobrang consistent ang setting, walang makikita na mali.
Napabilis ng kalahati, binago ayon sa tamang paraan
Pinakadirektang pagpapabilis ng bilis. Ang numero na ibinigay ng OpenAI ay ang pagbawas ng latency sa pagbuo ng hanggang 50% kumpara sa Images 2.0.
Pinabuting ang kalidad ng rendering ng liwanag at tekstura, at mas mataas ang pagkakatulad sa pangunahing tao sa larawan.
Ang precise editing ay tumutukoy sa isang lumang problema sa image generation tools: ang user ay humihingi ng pagbabago sa isang partikular na bahagi, ngunit ang model ay nagbabago rin sa mga bahaging hindi dapat galawin.
Ayon sa OpenAI, ang Images 2.5 ay maaaring baguhin ang mga partikular na rehiyon habang pinapanatili ang komposisyon, ilaw, at mga katangian ng pangunahing elemento sa natitirang bahagi ng imahe, na may malaking pagpapabuti sa katatagan sa mga komplikadong background at mga scene na may maraming pangunahing elemento.
Maaari rin ng mga user na maglagay ng mga komento at marka sa larawan, at i-circled ang mga posisyon na kailangang baguhin, na may logika na katulad ng design tool na Figma.

Ang pagkakasunod-sunod sa maraming pag-edit ay ang ikatlong pagpapabuti.
Sa habang pag-uusap, kapag binabago ang iisang imahe nang paulit-ulit, ang mga resulta sa mga unang ilang round ay mananatili, at ang kalidad ng imahe ay hindi mababawasan habang dumarami ang mga round.

Sinabi ng head of products ng Higgsfield AI, Axultan Alimkulov, tungkol sa Flare:
Ang pinakamalalim nating pagkakaunawa ay ang kanyang pag-unawa sa «ano ang hindi dapat baguhin».
Gumawa ng isang may kahulugang pag-edit na hindi magkakaroon ng pagkawala ng karakter, komposisyon, at istilo ng orihinal na imahe.

Sketch at mga template: Mula sa pagtype hanggang sa pagguhit
Sa antas ng produkto, ang Images 2.5 ay nagdala ng apat na bagong tampok.
Ang entry point ng Sketch ay sa pamamagitan ng pag-input ng @Sketch sa chat box ng ChatGPT, upang buksan ang sketch panel. Kapag isinusulat ng user ang isang sketch kasama ang deskripsyon ng estilo at detalye, gumagawa ang ChatGPT ng isang tapos na imahe batay sa sketch bilang gabay sa komposisyon.
Ang mga halimbawa na ibinigay ng OpenAI ay kasama ang pagbabago ng mga sketsa ng layout ng silid patungo sa mga render ng interior design, at ang pagbabago ng mga sketsa ng mga siluet ng tao patungo sa mga ilustrasyon. Ang hadlang ay hindi nasa kasanayan sa pagguhit, kundi sa pagguhit ng mga relasyon ng espasyo at malawak na proporsyon upang maunawaan ng modelo ang istruktura ng imahe.
Ang template ay kumakapal sa mga karaniwang format tulad ng poster, larawan ng produkto, at flyer.
Pumili ng isang template, punan ang impormasyon at mga preferensya sa estilo, at ang modelo ay maglalabas ng imahe ayon sa nakapre-set na istruktura, na nag-iwas sa pagsubok at pagkakamali sa pagsulat ng Prompt mula sa zero.
Ibahagi ang buong Prompt upang maipaglaban ng mga user ang kanilang nabuong imahe, at makagawa ng kanilang sariling bersyon gamit ang kanilang sariling larawan at detalye sa parehong framework.
Isang prompt na “80s Retro Portrait” ay naging viral sa mga social media platform, kung saan ang mga user ay maaaring i-upload ang kanilang sariling larawan upang makakuha ng mga litrato sa parehong estilo.

Ang apat na tampok ay nagtuturo sa iisang pagbabago: ang proseso ng pagpapalit ng imahe sa isipan sa isang larawan ay hindi na nakasalalay lamay sa pagket!
Flare at Sunburst: Unaang paghahati ng API
Para sa mga developer, sinync ng OpenAI ang dalawang image model sa API: GPT-Image-2.5 Flare at GPT-Image-2.5 Sunburst.
Ang Flare ay nakatuon sa bilis at batch generation, at itinuturing ng OpenAI ito bilang default na pagpili para sa karamihan sa mga aplikasyon.
Maaaring gamitin sa mga sosyal na nilalaman, mga larawan ng produkto, mabilis na prototipo, at madalas na paggawa ng mga larawan.
Mas tiyak ang datos ni Lucky Liao mula sa team ng pag-evaluate ng Manus: ang Flare ay nakamit ang bilis ng paggawa ng imahe na 2 hanggang 4 beses ang bilis ng GPT-Image-2 sa kanilang pagsubok, at ang pagpapabuti sa pagbuo ng transparent background ay direktang kapaki-pakinabang para sa programadong paglikha ng mga materyales para sa brand, mga presentasyon, at mga larawan para sa mga webpage.

Ang Sunburst ay nakatuon sa mataas na antas ng malikhaing workflow, na nagpapalit ng mas mahabang oras ng pagbuo para sa mas detalyadong kontrol sa pag-edit.
Ang karaniwang senaryo na ibinigay ng OpenAI ay ang mga成品级素材 at mga pinabuting larawan ng produkto para sa brand marketing.
Napatunayan ng Adobe ang pagpapakilala ng Images 2.5 model sa Firefly.
Sinabi ng Senior Director ng Adobe, Matt Chotin, na ang bersyon 2.5 ay nagdala ng mas mabilis na paggawa at pagkakatulad sa resolusyon, kaya nananatiling malinaw at totoo ang mga larawan pagkatapos ng maraming pagpapabuti.

Ang pagkakahati ng dalawang modelo ay tumutugon sa dalawang pangangailangan: mataas na kalikasan at mababang latency, at mataas na precision at customizasyon.
Ang Flare ay para sa mga skena ng malaking volume, ang Sunburst ay para sa mga skena ng mataas na kalidad, at ang mga developer ay maaaring pumili batay sa kanilang negosyo—hindi sila kailangang maghintay ng oras para sa precision na hindi nila gagamitin.
Ito ang unang pagkakataon na ginagawa ng OpenAI Image API ang product tiering batay sa bilis at kalidad, na patuloy ang lohika ng tiering ng Language Model API.
Ang pangalan ng Images 2.5 ay nagpapatuloy sa ritmo ng linya ng mga produkto ng OpenAI: hindi nagbabago ang arkitektura, ang bilis at karampatan ay unang umakyat.
Ginamit ng GPT-Image-1.5 noong katapusan ng 2024 ang parehong paraan.
Hindi isang taon ang pagitan ng dalawang bersyon na .5, at ang frequency ng pag-update ng image model ay nagsisimula nang umabot sa antas ng language model.
Ito ang pinakamalakas na image generation model sa mundo, may malaking lead.
Patuloy na pinapalakas ng OpenAI ang kanilang maramihang modalidad, malamang bilang tugon sa mga modelo ng Anthropic, sa pamamagitan ng pagpapalakas ng kakayahan tulad ng Computer-Use upang mapalakas ang mga base model tulad ng GPT-7.
Mga sanggunian:
https://openai.com/index/introducing-chatgpt-images-2-5/
Nakuha mula sa WeChat public account na "Xinzhiyuan" (ID: AI_era), may-akda: ASI Revelation, editor: Marco
