OpenAI назвала GPT-6 Astra своєю найрозумнішою та найбільш узгодженою з людськими намірами моделлю. Вона майже бездоганно пройшла складні тести з математики, логіки й кібербезпеки, однак незалежні експерти поки не готові визнати її повноцінним штучним загальним інтелектом.
Нова модель стала результатом багаторічних досліджень OpenAI у сфері попереднього навчання, навчання з підкріпленням та узгодження поведінки штучного інтелекту. Компанія також використала значні обчислювальні ресурси, хоча їхній точний масштаб не розкриває.
За даними OpenAI, Astra набрала 98% у FrontierMath Tier 4, 99,9% у ARC-AGI-3 та 100% у тесті ExploitBench. Результати стали підставою для заяв про те, що нова система може бути значним кроком на шляху до штучного загального інтелекту, або AGI.
Генеральний директор Nvidia та інвестор OpenAI Дженсен Хуанг пішов ще далі, заявивши, що Astra вже досягла AGI. Ідеться про рівень, за якого система здатна зрівнятися з людиною або перевершити її у широкому спектрі інтелектуальних завдань.

Водночас однозначно перевірити таку заяву неможливо. Експерти наголошують, що загальноприйнятого визначення AGI досі не існує, а високі результати в окремих тестах ще не доводять наявності універсального інтелекту.
Додаткові запитання виникли після публікації головного наукового співробітника OpenAI Якуба Пахоцького. За кілька днів після запуску Astra він попередив, що лабораторії створили інтелект, механізми роботи якого вже не можуть повністю зрозуміти. У міру масштабування таких систем ця проблема лише посилюватиметься.
Опитані фахівці не заперечують технічного прогресу Astra, але вважають, що гучні заяви навколо моделі одночасно виконують маркетингову функцію. Директорка з маркетингу Quickbase Аліс Рейндерс зазначила, що схвальна оцінка керівника найдорожчої публічної компанії та одного з головних переможців буму штучного інтелекту має велику цінність для OpenAI. На її думку, нинішній ажіотаж радше нагадує кампанію, покликану підтримати цікавість інвесторів та інших учасників перегонів у сфері ШІ.
Керівник досліджень і розробок у галузі штучного інтелекту BlogBuster Рассел Твіллігер також не вважає, що повноцінний AGI вже створено. Водночас він переконаний, що OpenAI наблизилася до цього рівня більше за інші великі лабораторії, включно з Anthropic. «На цьому етапі вони вже буквально стукають у двері», сказав Твіллігер.
Експерти також вказують на фінансову зацікавленість Nvidia. Якщо штучний загальний інтелект справді буде створено, попит на прискорювачі та іншу інфраструктуру компанії може суттєво зрости.
FrontierMath Tier 4 перевіряє здатність моделей розв’язувати найскладніші математичні задачі дослідницького рівня. Astra отримала 98%, тоді як GPT-5 за максимального рівня обчислень набирала близько 83%.
ARC-AGI-3 оцінює, наскільки добре система справляється з незнайомими завданнями, яких не було в її навчальних даних. Результат Astra у 99,9% означає фактичне насичення тесту: він уже майже не здатний показати різницю між цією моделлю та гіпотетично кращою системою.
Для порівняння, людина в цьому тесті отримала 48%, а показник GPT-5.6 Sol оцінюють приблизно у 30%.
Президент ARC Prize Foundation Грег Камрадт заявив, що Astra перевершила людський базовий рівень ефективності дій у 96% усіх рівнів і фактично досягла людського результату в межах цього тесту. Він назвав її найкращою моделлю, яку будь-коли перевіряла організація, та помітним стрибком у продуктивності передових систем.
Водночас навіть такий результат стосується лише конкретного тестового середовища. Він не доводить, що модель може на рівні людини працювати з усіма можливими завданнями в реальному світі.
ExploitBench перевіряє, чи здатна модель запускати програмні помилки, створювати складові експлойтів, діставатися до вразливого коду та домагатися виконання довільних команд.
Спочатку Astra тестували без захистів, які діють у її публічній версії. Для перевірки використовували ExploitBench та ExploitGym, щоб з’ясувати, чи може система перетворювати відомі вразливості на працездатні експлойти.
Через ризик потрапляння тестових даних у навчальну вибірку OpenAI створила внутрішню версію ExploitBench. У ній Astra набрала 100% проти 78,5% у GPT-5.6 Sol. У ExploitGym нова модель отримала 42,4%, тоді як результат Sol становив 30,3%.
Станом на період із червня до серпня 2026 року ExploitBench охоплював 20 критичних уразливостей рушія V8 у 13 стабільних випусках Chrome. Завдання моделі полягало в тому, щоб домогтися виконання довільного коду у V8 та офіційних Linux-версіях браузера.
OpenAI уточнює, що за умовами оцінювання деякі вразливості можуть узагалі не дозволяти виконати довільний код. Через це теоретично максимальний результат у такому тесті може бути недосяжним, що робить заявлені 100% Astra особливо помітними.
Технологічні компанії регулярно використовують результати тестів, щоб показати перевагу нових моделей над конкурентами. Однак насичення окремих бенчмарків створює іншу проблему: коли система набирає майже 100%, тест перестає бути корисним для порівняння ще потужніших моделей. OpenAI стверджує, що Astra не лише досягла максимальних показників, а й допомогла розв’язати відкриті проблеми в математиці. Проте незалежна перевірка таких тверджень і створення складніших тестів залишаються необхідними.