Ipinakilala ni OpenAI ang GPT-Image-2.5 na may mas mabilis na pagbuo at pinabuting pag-edit

icon MarsBit
I-share
AI summary iconSummary
Lumabas na ng OpenAI ang GPT-Image-2.5, na nag-aalok ng mas mabilis na paggawa at pinabuting pag-edit. Ang bagong bersyon ay hanggang 50% mas mabilis at nagdadagdag ng Sketch input mode. Maaari ngayon ng API users pumili sa pagitan ng Flare para sa bilis at Sunburst para sa kalidad. Naiayos na ang mga isyu sa pagpapakita ng Chinese text, at may mga template na available para sa mas madaling paglikha. Ang update ay sumasama kasama ang BTC update at nagpapahiwatig ng mga bagong token listing sa darating.

Kasalukuyang, inilabas ni OpenAI ang GPT-Images-2.5:

Nabawasan ng hanggang kalahati ang latency sa pagbuo, napabuti ang pagkakatumpak sa pag-edit, idinagdag ang bagong tampok ng pagsulat sa pamamagitan ng Sketch, at unang hihiwalay ang dalawang antas ng modelong mabilis at mabagal sa API.

GPT-Image-2.5

https://x.com/OpenAI/status/2097394956457623964

Buksan para sa lahat ng mga user ng ChatGPT, ChatGPT Work, at Codex, kabilang ang libreng bersyon.

Batay sa numerong ito, araw-araw ay humahantong sa halos 430 milyong mga larawan ang proseso ng sistema, at ang pagtaas ng bilis ng pagbuo ay may mas malawak na epekto kaysa sa karaniwang pag-update ng mga tampok.

Ipinahayag ng OpenAI ang kabuuang paggawa ng ChatGPT Images at GPT-Image API: 3 bilyong larawan kada linggo.

Demo na nakakapagtaka: Wala nang mga kakaibang karakter sa Chinese

Gaano kalakas ang GPT-Image-2.5? Tignan natin ang Demo nang direkta.

Ang mga kakaibang karakter sa Chinese ay nawala na!

GPT-Image-2.5

Ito ang reference na larawan:

GPT-Image-2.5

Ito ang output ng retro image:

GPT-Image-2.5

Maaari pa ba mong masabing kung ano ang totoong larawan at AI-generated image?

Ang pagkuha at pagpapalawig ng mga nakaprint na litrato sa mataas na kalidad na digital na larawan ay simpleng gawain.

GPT-Image-2.5

Gusto mo bang subukan ang visual effect ng pagbabago ng damit? Iwanan mo na lang sa ChatGPT:

Input:

GPT-Image-2.5

Output:

GPT-Image-2.5

I-input ang orihinal na larawan, ang kumot ay kakaibang kalagayan:

GPT-Image-2.5

I-output ang larawan ng maayos na napapalipat na kumot:

GPT-Image-2.5

Sobrang consistent ang setting, walang makikita na mali.

Napabilis ng kalahati, binago ayon sa tamang paraan

Pinakadirektang pagpapabilis ng bilis. Ang numero na ibinigay ng OpenAI ay ang pagbawas ng latency sa pagbuo ng hanggang 50% kumpara sa Images 2.0.

Pinabuting ang kalidad ng rendering ng liwanag at tekstura, at mas mataas ang pagkakatulad sa pangunahing tao sa larawan.

Ang precise editing ay tumutukoy sa isang lumang problema sa image generation tools: ang user ay humihingi ng pagbabago sa isang partikular na bahagi, ngunit ang model ay nagbabago rin sa mga bahaging hindi dapat galawin.

Ayon sa OpenAI, ang Images 2.5 ay maaaring baguhin ang mga partikular na rehiyon habang pinapanatili ang komposisyon, ilaw, at mga katangian ng pangunahing elemento sa natitirang bahagi ng imahe, na may malaking pagpapabuti sa katatagan sa mga komplikadong background at mga scene na may maraming pangunahing elemento.

Maaari rin ng mga user na maglagay ng mga komento at marka sa larawan, at i-circled ang mga posisyon na kailangang baguhin, na may logika na katulad ng design tool na Figma.

GPT-Image-2.5

Ang pagkakasunod-sunod sa maraming pag-edit ay ang ikatlong pagpapabuti.

Sa habang pag-uusap, kapag binabago ang iisang imahe nang paulit-ulit, ang mga resulta sa mga unang ilang round ay mananatili, at ang kalidad ng imahe ay hindi mababawasan habang dumarami ang mga round.

GPT-Image-2.5

Sinabi ng head of products ng Higgsfield AI, Axultan Alimkulov, tungkol sa Flare:

Ang pinakamalalim nating pagkakaunawa ay ang kanyang pag-unawa sa «ano ang hindi dapat baguhin».

Gumawa ng isang may kahulugang pag-edit na hindi magkakaroon ng pagkawala ng karakter, komposisyon, at istilo ng orihinal na imahe.

GPT-Image-2.5

Sketch at mga template: Mula sa pagtype hanggang sa pagguhit

Sa antas ng produkto, ang Images 2.5 ay nagdala ng apat na bagong tampok.

Ang entry point ng Sketch ay sa pamamagitan ng pag-input ng @Sketch sa chat box ng ChatGPT, upang buksan ang sketch panel. Kapag isinusulat ng user ang isang sketch kasama ang deskripsyon ng estilo at detalye, gumagawa ang ChatGPT ng isang tapos na imahe batay sa sketch bilang gabay sa komposisyon.

Ang mga halimbawa na ibinigay ng OpenAI ay kasama ang pagbabago ng mga sketsa ng layout ng silid patungo sa mga render ng interior design, at ang pagbabago ng mga sketsa ng mga siluet ng tao patungo sa mga ilustrasyon. Ang hadlang ay hindi nasa kasanayan sa pagguhit, kundi sa pagguhit ng mga relasyon ng espasyo at malawak na proporsyon upang maunawaan ng modelo ang istruktura ng imahe.

Ang template ay kumakapal sa mga karaniwang format tulad ng poster, larawan ng produkto, at flyer.

Pumili ng isang template, punan ang impormasyon at mga preferensya sa estilo, at ang modelo ay maglalabas ng imahe ayon sa nakapre-set na istruktura, na nag-iwas sa pagsubok at pagkakamali sa pagsulat ng Prompt mula sa zero.

Ibahagi ang buong Prompt upang maipaglaban ng mga user ang kanilang nabuong imahe, at makagawa ng kanilang sariling bersyon gamit ang kanilang sariling larawan at detalye sa parehong framework.

Isang prompt na “80s Retro Portrait” ay naging viral sa mga social media platform, kung saan ang mga user ay maaaring i-upload ang kanilang sariling larawan upang makakuha ng mga litrato sa parehong estilo.

GPT-Image-2.5

Ang apat na tampok ay nagtuturo sa iisang pagbabago: ang proseso ng pagpapalit ng imahe sa isipan sa isang larawan ay hindi na nakasalalay lamay sa pagket!

Flare at Sunburst: Unaang paghahati ng API

Para sa mga developer, sinync ng OpenAI ang dalawang image model sa API: GPT-Image-2.5 Flare at GPT-Image-2.5 Sunburst.

Ang Flare ay nakatuon sa bilis at batch generation, at itinuturing ng OpenAI ito bilang default na pagpili para sa karamihan sa mga aplikasyon.

Maaaring gamitin sa mga sosyal na nilalaman, mga larawan ng produkto, mabilis na prototipo, at madalas na paggawa ng mga larawan.

Mas tiyak ang datos ni Lucky Liao mula sa team ng pag-evaluate ng Manus: ang Flare ay nakamit ang bilis ng paggawa ng imahe na 2 hanggang 4 beses ang bilis ng GPT-Image-2 sa kanilang pagsubok, at ang pagpapabuti sa pagbuo ng transparent background ay direktang kapaki-pakinabang para sa programadong paglikha ng mga materyales para sa brand, mga presentasyon, at mga larawan para sa mga webpage.

GPT-Image-2.5

Ang Sunburst ay nakatuon sa mataas na antas ng malikhaing workflow, na nagpapalit ng mas mahabang oras ng pagbuo para sa mas detalyadong kontrol sa pag-edit.

Ang karaniwang senaryo na ibinigay ng OpenAI ay ang mga成品级素材 at mga pinabuting larawan ng produkto para sa brand marketing.

Napatunayan ng Adobe ang pagpapakilala ng Images 2.5 model sa Firefly.

Sinabi ng Senior Director ng Adobe, Matt Chotin, na ang bersyon 2.5 ay nagdala ng mas mabilis na paggawa at pagkakatulad sa resolusyon, kaya nananatiling malinaw at totoo ang mga larawan pagkatapos ng maraming pagpapabuti.

GPT-Image-2.5

Ang pagkakahati ng dalawang modelo ay tumutugon sa dalawang pangangailangan: mataas na kalikasan at mababang latency, at mataas na precision at customizasyon.

Ang Flare ay para sa mga skena ng malaking volume, ang Sunburst ay para sa mga skena ng mataas na kalidad, at ang mga developer ay maaaring pumili batay sa kanilang negosyo—hindi sila kailangang maghintay ng oras para sa precision na hindi nila gagamitin.

Ito ang unang pagkakataon na ginagawa ng OpenAI Image API ang product tiering batay sa bilis at kalidad, na patuloy ang lohika ng tiering ng Language Model API.

Ang pangalan ng Images 2.5 ay nagpapatuloy sa ritmo ng linya ng mga produkto ng OpenAI: hindi nagbabago ang arkitektura, ang bilis at karampatan ay unang umakyat.

Ginamit ng GPT-Image-1.5 noong katapusan ng 2024 ang parehong paraan.

Hindi isang taon ang pagitan ng dalawang bersyon na .5, at ang frequency ng pag-update ng image model ay nagsisimula nang umabot sa antas ng language model.

Ito ang pinakamalakas na image generation model sa mundo, may malaking lead.

Patuloy na pinapalakas ng OpenAI ang kanilang maramihang modalidad, malamang bilang tugon sa mga modelo ng Anthropic, sa pamamagitan ng pagpapalakas ng kakayahan tulad ng Computer-Use upang mapalakas ang mga base model tulad ng GPT-7.

Mga sanggunian:

https://openai.com/index/introducing-chatgpt-images-2-5/

Nakuha mula sa WeChat public account na "Xinzhiyuan" (ID: AI_era), may-akda: ASI Revelation, editor: Marco

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.