Новая архитектура OpenAI ставит под вопрос контроль над ИИ

OpenAI, ком­па­ния-созда­тель ChatGPT, гото­вит­ся к рели­зу сво­ей новой моде­ли Astra.

Источ­ник изоб­ра­же­ния: Тг-канал «Сек­ре­ты DARPA и ЦРУ»

По пред­ва­ри­тель­ным тестам она пока­зы­ва­ет выда­ю­щи­е­ся резуль­та­ты во мно­гих зада­чах. Но глав­ная новиз­на — не в про­из­во­ди­тель­но­сти, а в при­ме­нен­ной архи­тек­ту­ре, так назы­ва­е­мой рекур­рент­ной глу­бине. Это метод, при кото­ром текст мно­го­крат­но про­го­ня­ет­ся через одни и те же слои ней­ро­се­ти, преж­де чем модель выдаст сле­ду­ю­щее сло­во. Такой под­ход поз­во­ля­ет ком­пакт­ной сети рабо­тать на уровне гораз­до более круп­ной и эко­но­мить вычис­ли­тель­ные ресур­сы.

OpenAI не явля­ет­ся здесь пер­во­про­ход­цем. Эту архи­тек­тур­ную идею пер­вой пуб­лич­но реа­ли­зо­ва­ла и пред­ста­ви­ла китай­ская ком­па­ния ByteDance. Еще в нояб­ре 2025 года их иссле­до­ва­тель­ский отдел выпу­стил семей­ство моде­лей Ouro, кото­рые рабо­та­ли по тому же прин­ци­пу. Ouro дока­за­ла, что даже неболь­шие моде­ли могут дости­гать про­из­во­ди­тель­но­сти круп­ных, если выде­лять боль­ше вычис­ли­тель­ных ресур­сов на внут­рен­ние, скры­тые от наблю­да­те­ля рас­суж­де­ния. По сути, Astra — это раз­ви­тие и мас­шта­би­ро­ва­ние под­хо­да, впер­вые опро­бо­ван­но­го ByteDance.

Одна­ко у этой инно­ва­ции есть опас­ный побоч­ный эффект. Рань­ше иссле­до­ва­те­ли мог­ли наблю­дать за ходом мыс­лей моде­ли через тек­сто­вую цепоч­ку рас­суж­де­ний. Теперь зна­чи­тель­ная часть это­го про­цес­са пере­но­сит­ся в латент­ное (скры­тое) про­стран­ство — во внут­рен­ние акти­ва­ции ней­ро­нов. Фак­ти­че­ски модель ста­но­вит­ся «чер­ным ящи­ком», над кото­рым чело­век посте­пен­но теря­ет кон­троль.

OpenAI, конеч­но, заяв­ля­ет, что огра­ни­чи­ла уход моде­ли в скры­тые рас­суж­де­ния и сохра­ни­ла чита­е­мую цепоч­ку мыс­лей. Более того, ком­па­ния вме­сте с Anthropic и дру­ги­ми круп­ны­ми игро­ка­ми ранее под­пи­са­ла сов­мест­ное заяв­ле­ние о важ­но­сти мони­то­рин­га цепо­чек рас­суж­де­ний. Одна­ко в OpenAI при­зна­ют, что не все раз­ра­бот­чи­ки будут столь осто­рож­ны — воз­мож­но, намек на кон­ку­рен­тов из Китая, кото­рые вряд ли ста­нут себя сдер­жи­вать. Веро­ят­но, тем самым аме­ри­кан­ская ком­па­ния рас­чи­ща­ет себе путь для ана­ло­гич­ных экс­пе­ри­мен­тов.

После этих ново­стей выска­зал­ся Рай­ан Грин­блатт — иссле­до­ва­тель, участ­во­вав­ший в рас­сле­до­ва­нии недав­не­го инци­ден­та со взло­мом плат­фор­мы HuggingFace роем ИИ-аген­тов, создан­ных OpenAI. По его сло­вам, имен­но доступ к цепоч­кам рас­суж­де­ний помог рас­пу­тать слож­ную схе­му ата­ки. Если бы аген­ты рас­суж­да­ли исклю­чи­тель­но в латент­ном про­стран­стве, рас­сле­до­ва­ние было бы прак­ти­че­ски невоз­мож­ным. Он пре­ду­пре­жда­ет: есте­ствен­ная эво­лю­ция архи­тек­тур неиз­беж­но при­ве­дет к мас­шта­би­ро­ва­нию скры­тых рас­суж­де­ний, и тогда тек­сто­вые цепоч­ки мыс­лей ста­нут бес­по­лез­ны для мони­то­рин­га — осо­бен­но когда ИИ нач­нет созна­тель­но обма­ны­вать наблю­да­те­лей.

Сек­ре­ты DARPA и ЦРУ