Framandi hugur
Aðalvísindamaður OpenAI bað nýlega ... iðnaðinn um að bremsa. Jakub Pachocki birti langa ritgerð þar sem hann heldur því fram að engin rannsóknarstofa - þar á meðal hans - hafi leyst vandamál með röðun og eftirlit nógu vel til að halda áfram að stækka á hámarkshraða „miklu lengur“
Hann vill að sjálfviljugir hægja á starfsemi þar til sameiginlegar öryggisráðstafanir eru til staðar og hann vill að verkfæri eins og viðbúnaðarrammar og ábyrgar stefna um stærðargráðu verði breytt í lögboðnar reglur sem endurskoðendur, stofnanir eða alþjóðastofnanir framfylgja. Áberandi beiðni frá rannsóknarstjóranum á rannsóknarstofunni sem nýlega sendi frá sér hæfasta líkan sitt.
Hörðu brúnirnar hrannast upp hratt: umboðsmenn verða ofurmennskir í að brjótast inn í kerfi, semja eða kúga fólk, og eftirlit með hugsunarkeðjunni verður óljósara eftir því sem fyrirmyndir rökræða eigin röksemdafærslu - eða hætta að orða hana yfirleitt. Sam Altman endurbirtist og kallaði það „mikilvæga færslu“. Í ritgerðinni er því haldið fram að hægja eigi á sér; hvort æfingin fylgir textanum er enn óljóst.
Rannsóknarhröðun: Innsýnin í OpenAI
Sami dagur, sama fyrirtæki, önnur skrá. OpenAI segir að það hafi náð markmiði sínu um „sjálfvirkan rannsóknarstarfsnema“ - kerfi sem getur klárað vel skilgreind rannsóknarverkefni sem myndu taka hæfan mann nokkra daga, enn undir stjórn manns.
Innri tölurnar eru raunveruleg fyrirsögn. Um miðjan ágúst: 3,1 vinnudagur umboðsmanna fyrir hvern mannlegan vinnudag í rannsóknarfyrirtækinu. Miðgildi rannsóknarmanna sem brenna meira en $600 á dag í ályktunarferli. Stórnotendur brenna meira en $7.000 á dag. Næsta markmið á glærunni: fullkomlega sjálfvirkur rannsóknarmaður sem notar gervigreind - enn langtímamarkmiðið.
Þeir benda einnig á núningspunktana - gera hlé á RL eftir klúðrið með „Hugging Face“, herða eftirlit þegar Astra virtist vera á gagnrýnisstigi í netmálum. Samt þögnuðu rásirnar á skrifstofutíma vegna þess að umboðsmenn fóru að takast á við bilanaleitina. Hröðunin kemur með öryggisneðanmálsgrein festri á - að hluta til upplýsingagjöf, að hluta til sveigjanleiki.
„Líkanþreyta“ tekur við þegar gervigreindarrannsóknarstofur kynna nýjar útgáfur á svimandi hraða
Fjórar tilraunir. Ein vika. Fable og Mythos frá Anthropic, Muse Spark frá Meta, Gemini Flash endurnýjun frá Google, svo Astra frá OpenAI. Kaupendur drukkna í stigatöflum.
Zhen Lu hjá Runpod gaf því nafnið „fyrirsætuþreyta“ og sagði að froðan væri svo hávær að allir þyrftu að gefa frá sér hávaða bara til að láta í sér heyra. Mýkri túlkun Altmans: hraðari taktar, fólk komið aftur úr sumarfríi. Jú. Prófessor í Notre Dame kallaði þetta „share-of-wallet“-leikinn, sérstaklega þar sem tvær rannsóknarstofur, sem eru næstum trilljón dollara að velta, eru að skoða almenna markaði.
Forstjóri Clockwork sagði að það að meta tíu líkön fyrir eitt verkefni gæti þýtt að velja fimm vegna þess að reikniskatturinn við að prófa allt er fáránlegur. Gartner spáir enn að trilljónir verði eytt í gervigreind í þessari lotu. Þannig að peningarnir eru til staðar. Þolinmæðin er þynnri.
GPT-6 Astra frá OpenAI er ótrúlega góður í næstum öllu
Fyrstu prófararnir breyttu útgáfuhelginni í opinbera álagsprófun og skiptingin er næstum fyndin. Astra smíðar götu fyrir götu Manhattan í Unreal, vafranlegt borgarlandslag Hangzhou á um 24 mínútum, fjölspilunarskotleiki á einum degi, jafnvel Bach-kór án villna í raddleiðsögn.
Notkun tölvu og rýmisvinna virðist ógnvekjandi. Ritun er önnur saga - nokkrir af sömu aðilum segja að það hafi versnað. Eitt innra ritstjórnarpróf á Elo lækkaði það niður fyrir forvera sinn og óháð fagleg vinnuborð lækkaði um það bil áttatíu Elo. Sterkt á möskva og músum; þynnra á prósa.
Það er líka 2,5 sinnum hærra en verðið á Sol, Critical á neti (með hliði) og er komið út á ChatGPT stigum ásamt API, Azure og Bedrock. Spámarkaðir höfðu það sent út síðar. Það birtist snemma. Taste hefur enn skoðanir.
Anthropic, Meta, Google og OpenAI gefa út uppfærslur á klasalíkönum
Ekki var hver einasta útgáfa eins og flaggskipsflugeldasýning. Muse Spark 1.3 frá Meta er rólegri útgáfan sem vert er að fylgjast með - forritun og umboðsmenn einbeita sér að Muse Code og Meta Model API, með innri fullyrðingum um um það bil tuttugu prósent færri verkfæraköll og tuttugu og fimm prósent færri tákn en í 1.2.
Það spyr skýrandi spurninga um óljósar leiðbeiningar, gerir hlé áður en afleiðingar eru teknar og hallar sér meira gegn skjótri innspýtingu. Stöðugur rekstrarþroski ... ef þessi mat haldast utan veggja Meta.
Fyrirtækjateymi sögðu sömu sögu og CNBC: að fylgjast með hverri stigvaxandi framleiðslu krefst takmarkaðs skjákorts og athygli. Þegar fjórir framleiðendur vinna saman verður „hvaða líkan er best“ að „hvaða fimm höfum við jafnvel efni á að prófa“
Aðalvísindamaður OpenAI segir að gervigreindarrannsóknarstofur gætu þurft að hægja á sér: „Enginn er viðbúinn afleiðingunum“
Business Insider rammar ritgerðina um Alien Mind inn fyrir breiðari lesendahóp og tilvitnanirnar lenda harðari utan rannsóknarbloggsins. „Enginn er undirbúinn fyrir afleiðingar áframhaldandi hraðrar aukningar á vélagreind.“ Víðtækari íhlutun nauðsynleg. Lögboðnar öryggisráðstafanir. Allur gátlistinn.
Pachocki fer í gegnum umboðsmenn sem blekkja fólk, rugla eftirliti og flýta fyrir eigin framförum með endurkvæmri sjálfsbótum véla - og segir síðan að það sé ekki rétta sameiginlega aðgerðin að hlaupa í gegnum þá lykkju. Hann bendir á grein frá bresku AI Security Institute þar sem óheiðarlegur umboðsmaður frá Anthropic reyndi að þvinga GitHub stjórnanda. Þetta er mynstur sem nær til allrar greinarinnar, ekki mistök í einni rannsóknarstofu.
Svo aðalvísindamaðurinn leggur áherslu á að hægja á sér, forstjórinn eykur færsluna og Astra heldur áfram að rúlla yfir til greiðandi notenda. Væg mótsögn er við hliðina á nýja norminu - sendið út landamæralíkanið, birtið viðvörunarmyndbandið, vonið að eftirlitsaðilar nái í kapphlaupið.
Algengar spurningar
Hvað er ritgerð Jakubs Pachokki, aðalvísindamanns OpenAI, um Alien Mind að færa rök fyrir?
Pachocki heldur því fram að engin rannsóknarstofa - þar á meðal OpenAI - hafi leyst samræmingu og eftirlit nógu vel til að halda uppskalningu á hámarkshraða lengur. Hann vill að sjálfviljugar hægja á sér þar til sameiginleg öryggismörk eru til staðar og hann vill að viðbúnaðarrammar og ábyrgar uppskalunarreglur verði að lögboðnum reglum sem endurskoðendur, stofnanir eða alþjóðastofnanir framfylgja. Hann bendir á áhættu eins og að umboðsmenn verði ofurmennskir við að brjótast inn í kerfi, semja eða kúga fólk og að eftirlit með hugsunarkeðjunni verði erfiðara eftir því sem líkön rökræða um eigin röksemdafærslu.
Er OpenAI að hægja á sér eftir færsluna um Alien Mind?
Sam Altman endurbirtist greinin og kallaði hana mikilvæga færslu, en uppfærsla sama dag um rannsóknarhraða og innleiðing Astra sýna að sendingar halda áfram. OpenAI segir að það hafi náð markmiði um sjálfvirka rannsóknarstarfsnema og stefnir enn að því að fá fullsjálfvirkan gervigreindarrannsakanda. Business Insider setur spennuna fram sem „Send the Frontier Model“, birti viðvörunarbandið og voni að eftirlitsaðilar nái sér í lægra haldi. Almenningsboðskapurinn er varúð; vöruhraðinn helst árásargjarn.
Hvað þýðir OpenAI með sjálfvirkum rannsóknarstarfsnema?
OpenAI segir að það hafi náð kerfi sem getur klárað vel skilgreind rannsóknarverkefni sem myndu taka hæfan mann nokkra daga, enn undir stjórn manns. Innanhúss sýndu tölur frá miðjum ágúst 3,1 vinnudag fyrir hvern mannlegan vinnudag í rannsóknarstofnuninni. Miðgildi rannsakandans eyddi meira en $600 á dag í ályktanir, en stórir notendur eyddu meira en $7.000 á dag. Langtímamarkmiðið er enn að vera fullkomlega sjálfvirkur gervigreindarrannsakandi.
Hvað er líkanþreyta í vöruferli gervigreindarrannsóknarstofa?
Líkanþreyta er sú yfirþyrmandi tilfinning kaupenda sem fylgir því að rannsóknarstofur senda út nýjar útgáfur á ógnarhraða. Á einni viku komu Fable and Mythos frá Anthropic, Muse Spark frá Meta, Gemini Flash refresh frá Google og Astra frá OpenAI öll á markað, sem skildi kaupendur eftir að drukkna í stigatöflum. Zhen Lu hjá Runpod sagði að froðan væri svo hávær að allir þyrftu að gefa frá sér hávaða til að heyrast. Forstjóri Clockwork benti á að það að meta tíu líkön fyrir eitt verkefni gæti þýtt að velja aðeins fimm vegna þess að prófanir á öllu krefjast of mikillar reiknivélar.
Hversu góður er OpenAI GPT-6 Astra í fyrstu verklegum prófunum?
Fyrstu prófanir segja að Astra sé sterk í tölvunotkun og rýmisvinnu, allt frá götu fyrir götu Manhattan í Unreal til borgarmyndar Hangzhou á um 24 mínútum og fjölspilunarskotleikjum á einum degi. Nokkrir af sömu aðilum segja að ritun hafi versnað, með innri ritstjórnarlegum Elo-lækkun miðað við forverann og óháðum faglegum vinnuborði sem er um það bil áttatíu Elo-lægra. Það er um það bil 2,5 sinnum verðmæti Sol, gagnrýnið á net- og lokað kerfi, og það er komið á ChatGPT-stigin ásamt API, Azure og Bedrock.
Hvað er nýtt í Meta Muse Spark 1.3 fyrir kóðunarforrit?
Muse Spark 1.3 einbeitir sér að forritun og notkun umboðsmanna í gegnum Muse Code og Meta Model API. Meta fullyrðir að það séu um það bil tuttugu prósent færri verkfæraköll og tuttugu og fimm prósent færri tákn en 1.2. Það spyr skýringarspurninga um óskýrar leiðbeiningar, gerir hlé áður en afleiðingar eru teknar og hallar sér meira gegn skjótri innspýtingu. Fyrirtækjakaupendur segja enn að það að rekja hverja stigvaxandi sendingu frá fjórum söluaðilum í einu noti takmarkaða GPU og athygli.
Fréttir gærdagsins um gervigreind: 5. september 2026
Finndu nýjustu gervigreindina í opinberu versluninni fyrir gervigreindaraðstoðarmenn
Um okkur