«Апошні экзамен чалавецтва». Для нейрасетак стварылі максімальна складаны акадэмічны тэст — і вось які вынік
Прафесары, навукоўцы, а таксама выбітныя выпускнікі і студэнты з амаль 500 прэстыжных адукацыйных установаў па ўсім свеце вырашылі даць апошні акадэмічны бой сістэмам штучнага інтэлекту, стварыўшы для іх самы складаны з усіх магчымых тэстаў экспертнага ўзроўню на разважанне і валоданне тэхнічнымі ведамі. Нейрасеткі (у тым ліку ChatGPT і нашумелы кітайскі DeepSeek) выклік прынялі і ўжо паказалі першыя вынікі.
Міжнародная каманда з 1000 экспертаў у розных акадэмічных дысцыплінах з амаль 500 прэстыжных адукацыйных устаноў (сярод якіх Оксфард, Гарвард, Кэмбрыдж, Стэнфард, швейцарскі ETH, французская Inria і іншыя) распрацавалі глабальны тэст па тэхнічных і перадавых навуковых ведах і лагічным мысленні для вымярэння ўзроўню дасканаласці сістэм штучнага інтэлекту.
Тэст атрымаў назву HLE (Humanity's Last Exam), ці «Апошні экзамен чалавецтва». Эксперты назвалі яго самым складаным акадэмічным выпрабаваннем у гісторыі, які можна стварыць для тэсціравання магчымасцяў нейрасетак у дакладных навуках, не закранаючы аспект творчых здольнасцяў.
Экзамен HLE складаецца з трох тысяч складаных пытанняў па ста розных дысцыплінах (напрыклад, класічная філалогія, хімія, вышэйшая матэматыка, інфарматыка, экалогія, лінгвістыка). Фарматаў заданняў два: пытанні з дакладным супадзеннем (ШІ-мадэлі самі пішуць тэкст у якасці адказу) і пытанні з выбарам адказу (ШІ выбірае адзін з пяці або больш варыянтаў адказу). Асаблівы акцэнт у тэсце таксама робіцца на разуменні схем і выяваў.
У тэсце ўжо прынялі ўдзел некалькі топавых нейрасетак, такія як ChatGPT (старыя і найноўшыя версіі), Claude (папулярны ў бізнэсменаў і праграмістаў), Gemini (ад карпарацыі Google), Grok (ШІ ад Ілана Маска) і DeepSeek (кітайская нейрасетка, якая абваліла ўвесь тэхналагічны сектар ЗША).
Усе яны з трэскам правалілі экзамен (у плюс-мінус 90% пытанняў мадэлі давалі няправільны адказ, ды і яшчэ настойвалі на тым, што мелі рацыю), адзначылі аўтары тэста HLE.
Ёсць і паказальны момант — найгоршы і адначасова найлепшы вынік прадэманстраваў ChatGPT (яго старая звычайная версія Омні паказала 3,3% дакладнасці адказаў, сярэдняя o1 паказала вынік 9,1, а найноўшая о3-mini-high — 13). А нашумелы кітайскі DeepSeek, якога днямі назвалі «забойцай ChatGPT», паказаў 9,4% дакладнасці адказаў.
Таксама паказальна, што існуючыя складаныя глабальныя тэсты на навуковыя веды, такія як GPQA, MATH і MMLU, даваліся вышэйпералічаным нейрасеткам нашмат лягчэй, і тыя мелі ў іх ад 40 да амаль 100 адсоткаў правільных адказаў.
Аднак цяпер са стварэннем тэста HLE чалавецтва кінула штучнаму інтэлекту вельмі сур'ёзны выклік, але ён, як сумна канстатуюць эксперты, можа стаць апошнім. Па прагнозах аўтараў HLE, нейрасеткі могуць дасягнуць у экзамене 50% дакладнасці адказаў ужо ў канцы гэтага года.
Каментары
Трудно сказать, что они там видят.
Никто исчерпывающе не представляет ход рассуждений ИИ.
Управление и цензура в основном заключается в запрещении тех или иных действий, ответов, реакций.
Нецензурированный ИИ вполне может дать ответ "убить всех больных" на вопрос "как сделать всех здоровыми"
И разве ответ неправильный?