Kaya ba ng bilis at presyo na magkasama, at naging bagong battlefield sa kompetisyon ng mga generative image model.May-akda ng artikulo, pinagkukunan: AIBase
Background ng pagpapalabas
Ipinakilala ng Microsoft noong Setyembre ang light-weight na bersyon ng kanilang sariling image generation model, ang MAI-Image-2.6-Flash, at nagsimula na ang public preview sa pamamagitan ng Microsoft Foundry. Bilang mas epektibong bersyon ng MAI-Image-2.6 na nasa unang bahagi ng teknikal na ranking noong nakaraang buwan, ang paglalabas ng model na ito ay nagmarka ng malaking hakbang ng Microsoft sa pagbuo ng kanilang estratehiya sa larangan ng AI image generation para sa mga industriyal na aplikasyon na nangangailangan ng mataas na concurrency, mababang latency, at cost sensitivity.
Performance
Ang mga resulta ng pagsubok ay nagpapakita na ang bilis ng pagbuo ng imahe ng MAI-Image-2.6-Flash ay umabot sa 2.8 beses ang bilis ng GPT-Image-2-Medium, na nagdudulot ng 72% na pagtaas sa pangkabuuang epekto. Habang malaki ang pagbawas sa latency ng pagpapaliwanag at mga gastos sa komputasyon, ang bersyon na ito ay nagmamana nang buo sa pangunahing modelo ng mga pangunahing kakayahan sa pagbuo at pag-edit, at sumusuporta sa mataas na precision sa text-to-image generation at lokal na pag-edit ng imahe sa antas ng object.
Upgrade sa arkitektura
Dagdag pa, ang buong MAI-Image-2.6 series ay nagdala ng mga pagpapabuti sa antas ng arkitektura, kabilang ang suporta sa hanggang 5 na reference image upang masiguro ang pagkakatulad ng mga karakter at produkto sa maraming imahe, integrasyon ng web-based na paghahanap sa Bing upang mapalawak ang impormasyon mula sa mga real-world na imahe, at bagong suporta para sa native dynamic aspect ratio at mas mataas na resolution output.
Sa komersyal na pricing strategy, bumaba ang presyo ng bawat milyong Token para sa text input, image input, at image output sa Flash version hanggang sa $1.75, $2.50, at $19, na nagdudulot ng mas higit sa 50% na pagbaba ng gastos kumpara sa main model.
Inirerekomenda ng Microsoft na gamitin ang pangunahing modelo para sa mga komersyal na disenyo at huling produksyon na may mataas na kahilingan sa kalidad ng imahe at pag-render ng teksto, habang ang bersyon ng Flash ay eksaktong inilalayong gamitin para sa interaktibong aplikasyon, mabilis na pag-iterate ng kreatibo, at malawakang awtomatizado na proseso. Ang multi-modal na modelo na ito, na nagtataglay ng ekstremong performance at ekstremong value-for-money, ay nagpapakita ng kasalukuyang trend sa industriya kung saan ang generative AI ay umuunlad mula sa isang pambabatid na teknolohiya patungo sa high-throughput, mura at inhenyerya na pagpapatupad.
