Inilunsad ng OpenAI ang ChatGPT Images na may GPT Image 1.5: mas mabilis, mas tumpak, at may naka-embed na teksto

  • Pinapabilis ng GPT Image 1.5 ang pagbuo ng imahe sa loob ng ChatGPT nang hanggang apat na beses.
  • Ang bagong modelo ay nagbibigay-daan para sa mga napakatumpak na pag-edit nang hindi nawawala ang biswal na pagkakapare-pareho o estilo.
  • Isinasama ng ChatGPT Images ang sarili nitong espasyong tipong "creative studio" na may mga paunang natukoy na estilo at filter.
  • Pinalalakas ng OpenAI ang biswal na pokus nito upang makipagkumpitensya sa Google Gemini at Nano Banana Pro sa paglikha ng imahe.

Tagabuo ng Larawan ng AI ng ChatGPT Images

Ang bagong tampok na ChatGPT Images ay nagmamarka ng isang mahalagang hakbang sa kung paano isinasama ng OpenAI ang visual generation sa conversational assistant nito. Gamit ang GPT Image 1.5, pinapalakas ng kumpanya ang kakayahan sa graphics ng ChatGPT nang may mas mabilis na bilis, pinahusay na pag-eedit, at mas malawak na kontrol sa huling resulta, sa gitna ng isang mapagkumpitensyang karera kasama ang Google at ang Gemini ecosystem nito.

Ang update ay higit pa sa paggawa lamang ng mas kaakit-akit na mga imahe; nilalayon nitong tiyakin na lubos na nirerespeto ng sistema ang layunin ng gumagamit sa bawat pagbabago. Ang layunin ay ang ChatGPT ay umunlad mula sa isang advanced na text chat patungo sa isang espasyo kung saan ang pagsusulat, pag-eedit, at muling paggamit ng mga imahe ay parang pagtatrabaho sa isang kumpletong creative studio.

Ano ang ChatGPT Images at ano ang iniaalok ng GPT Image 1.5?

Gamit ang ChatGPT Images, direktang isinasama ng OpenAI ang isang modelo ng pagbuo at pag-eedit ng imahe sa interface ng assistant , na may kakayahang gumana mula sa simula o mula sa mga umiiral na litrato o disenyo. Sa puso ng inobasyong ito ay ang GPT Image 1.5 , isang binagong bersyon ng visual model na ginagamit na sa ChatGPT, na ngayon ay na-optimize upang sundin ang mga kumplikadong tagubilin nang may mas mataas na katumpakan.

Ang pangunahing pagkakaiba ay nasa kakayahan ng modelo na baguhin lamang ang hinihiling dito : kung ang ilaw, background, o isang maliit na detalye ng eksena ay binago, ang natitirang bahagi ng imahe ay nananatiling pare-pareho. Ang mga elemento tulad ng mga katangian ng mukha, framing, pangkalahatang istilo, at komposisyon ay nananatiling matatag kahit na pagkatapos ng ilang pag-ikot ng mga pagbabago—isang bagay na hanggang ngayon ay isang pangunahing kahinaan ng karamihan sa mga AI generator.

Ang kakayahang mapanatili ang pagkakapare-pareho ay lalong kapansin-pansin kapag gumagamit ng mga larawang in-upload ng user . Mas nauunawaan ng system kung aling mga bahagi ng larawan ang dapat panatilihin at alin ang dapat baguhin, na iniiwasan ang epekto ng "ganap na bagong larawan" na kadalasang pumipilit sa proseso na muling simulan mula sa simula.

Bukod pa rito, namumukod-tangi ang GPT Image 1.5 dahil sa mas maaasahan nitong pagsubaybay sa mahahaba at magkakasunod na mga tagubilin . Maaaring maglapat ang modelo ng mga pagbabago nang paunti-unti nang hindi nawawala ang orihinal na istruktura, na nagbibigay-daan sa mas kumplikadong mga komposisyon kung saan ang mga ugnayan sa pagitan ng mga elemento (distansya, relatibong posisyon, proporsyon) ay pinapanatili ayon sa hiniling.

Interface ng Mga Larawan ng ChatGPT

Bilis at daloy ng trabaho: hanggang apat na beses na mas mabilis na pag-imaging

Isa pang mahalagang aspeto ng paglabas ay ang malaking pagbuti sa mga oras ng pagtugon. Inaangkin ng OpenAI na ang GPT Image 1.5 ay nakakabuo ng mga imahe nang hanggang apat na beses na mas mabilis kaysa sa nakaraang modelo, na binabawasan ang mga oras ng paghihintay na dating humahadlang sa malikhaing gawain kapag nagpapatakbo ng maraming pagsubok nang sunud-sunod.

Ang ideya ay maaaring subukan, itama, at pinuhin ng mga gumagamit ang mga disenyo nang halos tuluy-tuloy , nang hindi nagiging hadlang ang latency. Habang pinoproseso ang isang imahe, maaaring gumawa ng mga bagong kahilingan o galugarin ang mga alternatibong pamamaraan, na mas naaayon sa mga totoong daloy ng trabaho sa mga studio ng disenyo, mga ahensya ng marketing, o mga departamento ng digital na nilalaman.

Binigyang-diin din ng kumpanya na ang bagong modelo ay hindi lamang mas mabilis, kundi nagbibigay din ng mas kapaki-pakinabang na mga resulta sa unang pagsubok . Ang pag-render ng maraming maliliit na mukha sa isang eksena, ang natural na anyo ng mga materyales o background, at ang pagsasama ng mga idinagdag na elemento sa loob ng orihinal na ilaw ay pawang mga aspeto ng pagpapabuti, na nagbabawas sa pangangailangang ulitin ang parehong kahilingan nang maraming beses.

Mula sa pananaw ng produktibidad, ang kombinasyong ito ng mas mabilis na bilis at mas mataas na katumpakan ay naglalayong baguhin ang mga Larawan ng ChatGPT mula sa isang simpleng kagamitang pang-eksperimento tungo sa isang mabisang opsyon para sa mga propesyonal na proyekto. Ang parehong mga independiyenteng tagalikha at mga pangkat ng nilalaman ay maaaring maglaan ng mas maraming oras sa pagpapasya kung ano ang gusto nilang ibahagi at mas kaunting oras sa paghihirap sa modelo.

Paulit-ulit na pag-edit, teksto sa larawan, at kontrol sa pagiging malikhain

Isa sa mga pangunahing pagbabago sa pamamaraan sa GPT Image 1.5 ay ang paulit-ulit na pag-eedit nito . Sa halip na bumuo ng isang ganap na bagong imahe sa bawat oras na binabago ng gumagamit ang isang tagubilin, ang modelo ay nakatuon sa paglalapat ng mga hiniling na pagsasaayos sa umiiral na database. Mahalaga ito sa mga proyekto kung saan ang visual na pagkakapare-pareho —halimbawa, sa mga kampanya sa advertising, pagkakakilanlan ng tatak, o mga katalogo ng produkto — ay kasinghalaga ng pangwakas na resulta.

Ang modelo ay mahusay na gumaganap sa mga gawain tulad ng pagdaragdag, pag-aalis, pagsasama-sama, o paglilipat ng posisyon ng mga elemento habang pinapanatili ang mga pangunahing katangian na nagpapakilala sa isang eksena. Maaari mo itong hilingin na magdagdag ng isang bagay sa background, palitan ang damit ng isang tao, o baguhin ang kapaligiran (mula araw hanggang gabi, mula tag-araw hanggang taglamig) nang hindi "nalilimutan" ng modelo ang pangkalahatang istruktura ng imahe.

Dagdag pa rito ang isang mahalagang pagpapabuti: ang pag-render ng teksto sa loob ng mga imahe . Ang GPT Image 1.5 ay may kakayahang mag-render ng mas siksik na teksto na may mas maliliit na laki ng font, na nagbubukas ng pinto sa paglikha ng mga poster, menu, infographic, at mga piraso ng editoryal kung saan ang tipograpiya ay hindi na magmumukhang baluktot o hindi makilala. Sa kontekstong Europeo, kung saan ang mga signage, mga dokumentong pang-impormasyon, at mga materyales ng korporasyon ay nangangailangan ng kakayahang mabasa, ang pagsulong na ito ay partikular na mahalaga.

Binanggit ng OpenAI na ang modelo ay mas "malikhain" din sa kung paano nito binabago at dinadagdagan ng mga elemento ng disenyo . Mula sa medyo simpleng mga prompt, ang ChatGPT Images ay maaaring magmungkahi ng makatwiran at biswal na pare-parehong mga komposisyon, kahit na walang labis na detalyadong mga prompt. Binabawasan nito ang hadlang sa pagpasok para sa mga gumagamit na hindi sanay sa pagsusulat ng mga kumplikadong tagubilin.

Kasabay nito, para sa mga nagnanais ng mahusay na kontrol, mas mahusay na tumutugon ang sistema sa mahahabang hanay ng mga tagubilin , na nagbibigay-daan para sa unti-unting pagsasaayos sa mga kulay, estilo, layout ng elemento, at mga font. Ang kombinasyon ng parehong pamamaraan—ginabayang paggalugad at detalyadong kontrol—ay naglalayong magbigay-daan sa parehong mga ekspertong malikhaing propesyonal at mas pangkalahatang mga gumagamit.

Isang nakalaang espasyo sa loob ng ChatGPT: tungo sa isang visual na "studio"

Ang paglulunsad ng ChatGPT Images ay hindi lamang isang pagbabago sa modelo, kundi pati na rin sa karanasan ng gumagamit. Nagpakilala ang OpenAI ng isang nakalaang espasyo para sa mga imahe sa interface ng ChatGPT , na mapupuntahan mula sa sidebar, na gumagana nang mas katulad ng isang maliit na creative studio na nagsasama ng mga estilo, filter, at mungkahi.

Sa ganitong kapaligiran, maaaring tuklasin ng mga user ang mga paunang natukoy na istilo , subukan ang mga filter, baguhin ang isang paunang nabuo na imahe, o gumawa mula sa isang litratong in-upload ng user, lahat nang hindi kinakailangang magsulat ng mga kumplikadong tagubilin. Ito ay isang paraan upang gawing mas naa-access ang visual generation sa mga mas sanay sa mga mobile app o online editor kaysa sa mahahabang at tradisyonal na AI prompt.

Sinasabi ng kumpanya na ang pangkalahatang karanasan sa ChatGPT ay magsasama ng mas maraming visual at multimodal na elemento, tulad ng voice mode, sa iba pang mga bahagi ng assistant. Ang mga resulta ng paghahanap, mga paliwanag ng mga konsepto, at mga praktikal na query—tulad ng mga unit conversion o data ng sports—ay maaaring lalong umasa sa mga tsart, diagram, o flowchart upang gawing mas malinaw ang impormasyon.

Ang pinagbabatayang pilosopiya ay kapag ang isang sagot ay mas mahusay na maipaliwanag gamit ang isang imahe kaysa sa teksto lamang, ang visual na suporta ay dapat na ialok nang natively . Ang pamamaraang ito ay naaayon sa trend sa mga platform ng edukasyon, digital media, at mga productivity app sa Europa, kung saan ang pagsasama-sama ng teksto at mga imahe ay naging karaniwang kasanayan para sa pagpapabuti ng pag-unawa at pagpapanatili.

Kasabay nito, nilalayon ng biswal na espasyong ito na bawasan ang distansya sa pagitan ng panimulang ideya at ng huling resulta: mas kaunting pagtalon sa pagitan ng mga tool, mas kaunting pabalik-balik sa pagitan ng chat, image generator at mga panlabas na editor, at mas malaking kakayahang dalhin ang isang ideya mula sa sketch patungo sa isang halos pangwakas na bersyon nang hindi umaalis sa parehong kapaligiran.

Kompetisyon sa Google Gemini at Nano Banana Pro

Ang pagdating ng ChatGPT Images at GPT Image 1.5 ay kasabay ng direktang kompetisyon sa Google sa larangan ng generative AI. Sa mga nakaraang buwan, ang search engine ay naging kilala dahil sa pamilyang Gemini ng mga modelo nito at, sa partikular, dahil sa mga tool tulad ng Nano Banana Pro (Gemini 3 Pro Image) , na ipinagmamalaki ang mas malawak na kaalaman sa mundo at isang matibay na kakayahang mag-render ng teksto sa mga imahe.

Ang mga pagsulong na ito ang nagbigay-daan sa Google na manguna sa ilang espesyalisadong ranggo, na nagdulot ng alarma sa OpenAI. Sa loob ng bansa, nagkaroon pa nga ng usap-usapan tungkol sa isang "code red" upang ilarawan ang pangangailangang mabilis na tumugon at mabawi ang bahagi sa merkado at persepsyon sa teknolohiya, lalo na sa mga developer at kumpanya.

Sa kontekstong ito, ang GPT Image 1.5 ay nagpapakita ng sarili bilang isang direktang tugon, na may bahagyang kakaibang pamamaraan: Nakatuon ang Google sa napakabilis na pagbuo at visual improvisation , na kapaki-pakinabang para sa mabilisang mga ideya o prototype, habang binibigyang-diin ng OpenAI ang paulit-ulit na pag-eedit at visual consistency. Sa madaling salita, ang Nano Banana Pro ay may tendensiyang "muling bigyang-kahulugan" ang eksena sa bawat pagbabago, habang ang ChatGPT Images ay nagtatangkang bumuo ng bersyon por bersyon nang hindi ganap na itinatapon ang mga nakaraang gawa.

Ang pagkakaibang ito sa pilosopiya ay lalong mahalaga para sa disenyo, marketing, media, at e-commerce sa Europa , kung saan kinakailangan ang mga pare-parehong imahe sa paglipas ng panahon: mga kampanyang nagpapanatili ng parehong estetika, mga katalogo na nagpapanatili ng hitsura ng produkto, o mga impormasyong dapat sumunod sa isang itinatag na istilo ng grapiko.

Ang opensiba ng OpenAI ay hindi isang nakahiwalay na pangyayari. Sinusundan nito ang mga hakbang tulad ng paglulunsad ng GPT-5.2 , na naglalayong sa mga developer at propesyonal, at bahagi ng mas malawak na estratehiya upang palakasin ang posisyon nito sa parehong teksto at biswal na aspeto ng generative AI sa harap ng momentum ng Gemini ecosystem.

Kakayahang magamit, mga gamit at kasalukuyang mga limitasyon ng modelo

Sinimulan na ng OpenAI ang malawakang paglulunsad ng GPT Image 1.5 sa ChatGPT , na nagbibigay-daan sa sinumang user na magsimulang bumuo at mag-edit ng mga imahe nang direkta mula sa interface ng assistant. Bukod pa rito, maa-access din ang modelo sa pamamagitan ng API ng kumpanya , na nagpapahintulot sa mga European developer na isama ang mga kakayahan nito sa mga application, website, o internal tool.

Para sa mga bersyong Pangnegosyo at Pang-enterprise, nagpaplano ang kumpanya ng unti-unting paglulunsad , upang masubukan ng mga negosyo ang mga bagong tampok sa kanilang mga visual workflow, mula sa paglikha ng mga materyales sa marketing hanggang sa pagbuo ng mga panloob na mapagkukunan ng grapiko para sa dokumentasyon o pagsasanay.

Bagama't kitang-kita ang pag-unlad sa kalidad, kinikilala ng OpenAI na ang modelo ay mayroon pa ring mga makabuluhang limitasyon . Kabilang dito ang kahirapan sa pagpapanatili ng eksaktong pagkakakilanlan ng bawat tao kapag ang isang malaking grupo ay lumilitaw sa iisang imahe, at ilang mga hindi pagkakapare-pareho sa mga pagsasalin at pag-render ng teksto para sa mga wikang tulad ng Tsino, Arabe, o Hebreo , kung saan ang tipograpiya at direksyon ng pagsulat ay nagdudulot ng karagdagang mga hamon.

Sa kabila nito, binibigyang-diin ng kumpanya na ang GPT Image 1.5 ay lubos na nagpapabuti sa tumpak na pag-eedit at paglikha ng mga kumplikadong komposisyon kumpara sa mga nakaraang henerasyon. Ang modelo ay partikular na nakatuon sa mga kailangang ulit-ulitin ang parehong imahe nang maraming beses nang hindi nawawala ang mga detalyeng nagpapakilala dito.

Sa mas mapaglarong antas, pinapalakas din ng ChatGPT Images ang paggamit ng visual AI bilang isang kasangkapan sa libangan . Ang kakayahang muling isipin ang isang tao bilang isang makasaysayang pigura, atleta, superhero, o bida sa mga eksena ng pantasya ay nananatiling isang pangunahing atraksyon para sa pangkalahatang publiko, at ngayon ay maaari na itong gawin nang may mas mabilis at mas kontrol.

Dahil sa lahat ng mga bagong tampok na ito, ang panukala ng OpenAI para sa mga imahe ay nagiging mas ambisyoso: isang kumpletong plataporma kung saan maaari kang magplano, lumikha, at pinuhin ang visual na nilalaman nang tuluy-tuloy, na pinagsasama ang malikhaing eksperimento sa mga hinihingi ng mga propesyonal na proyekto sa Espanya at sa iba pang bahagi ng Europa.

Ina-activate ng Google ang 'AI Mode' sa Spain
Kaugnay na artikulo:
Ina-activate ng Google ang AI Mode sa Spain: ganito ang pagbabago sa mga paghahanap

Idagdag bilang ginustong mapagkukunan sa Google