← Összes sztori
📚

OpenAI nagy kötegnyi AI-generált matematikai eredménye

OpenAI nyilvánosságra hozott egy nagy csomagot: 722 kéziratot, amelyek 372 „eredménycsaládba” rendezve érkeztek, és amelyeket egy belső, ki nem adott AI-modell állított elő. A cég szerint a modellhez hozzávetőleg 4 000 problémát tettek fel, majd azokat az outputokat tartották meg és publikálták, amelyeket jelentősnek ítéltek. A kiadásban szereplő anyagok több területet fednek: számelmélet, algebrai geometriát, analízist és elméleti számítástechnikát. OpenAI közölte, hogy a gyűjtemény nagy része Lean 4 formálisizációval készült, amelyekben a bizonyításlépések gépi ellenőrzése történik, ám a források között eltérések vannak a formalizációk arányát illetően: a korábbi jelentések szerint 162 kézirathoz (a 722-ből) készült Lean-formalizáció, míg a későbbi számítások 42 százalék körüli, azaz körülbelül 300 formalizált eredményt említenek. A cég maga is figyelmeztetett arra, hogy nem minden kézirat rendelkezik Lean-ellenőrzéssel és „néhány nem formalizált eredmény problémákat rejthet”.

A közlemény nyomatékosítja a transzparencia és a verifikáció hiányát: maga a modellszoftver nem került kiadásra, a publikáció GitHubon történt, de OpenAI nem adta meg a használt promptokat, és a tárolóban az Issues kikapcsolva van, pull requesteket pedig soha nem fogadtak el. A társadalomtudósokból és matematikusokból álló közösség ezért szkeptikus; Andrew Sutherland az MIT-ről és más kutatók „nyugtázást” kérnek — vagyis hogy a modellt és a promptokat is adják ki, hogy eredmények reprodukálhatók legyenek. Ugyanakkor az Institute for Advanced Study által ajánlott iránymutatásokkal OpenAI konzultált, és a cég kiadott átlagos számítási adatokat és tíz rövid, összefoglalt gondolatmenetet is.

A kiadás gyakorlati következményei és a vita részét képezi az, hogy korábban szeptemberben OpenAI a Navier–Stokes problémán bejelentett előrelépést is említette; ez az erőfeszítés állítólag körülbelül 10 000 AI-ügynök összehangolt munkáját és 88 órás ideig tartó futtatást foglalta magában. A mostani katalógus rámutat arra is, hogy rögtön három kéziratot visszavontak hibák miatt. A közösség feladata a triázs: mely eredmények igényelnek emberi ellenőrzést, melyek azok, amelyek Lean-formalizáció révén már mechanikus ellenőrzésen mentek keresztül, és melyek azok, amelyek további visszajelzést, javítást vagy hitelesítést igényelnek. A nyomon követendő szempontok közé tartozik további visszavonások esélye, a Riemann-hipotézishez kapcsolódó eredmény független ellenőrzése, valamint az, hogy OpenAI megosztja-e végül a modellt, a promptokat és a részletes módszertant.