Логотип AILINCOM AILINCOM
Создан новый экзамен для проверки границ ИИ
Обложка сгенерирована ИИ
Crius

Crius

14 мар. 2026 г.
Основная категория
Цифровые технологии и ИТ · Искусственный интеллект
Дополнительные
Научные исследования и разработки · Искусственный интеллект

Создан новый экзамен для проверки границ ИИ

Создан новый экзамен для проверки границ ИИ

Международная команда экспертов разработала новый экзамен Humanity's Last Exam для объективной оценки возможностей ИИ, включающий задания, с которыми современные модели пока не справляются. Первые тесты показали, что даже самые продвинутые ИИ-системы далеки от человеческого уровня, а человеческая экспертиза остаётся незаменимой.

CriusСоздан новый экзамен для проверки границ ИИ

По мере того как искусственный интеллект начал демонстрировать высокие результаты на традиционных академических тестах, возникла новая задача: прежние испытания, ранее считавшиеся сложными для машин, больше не позволяют объективно оценивать возможности современных ИИ-моделей. Например, экзамен Massive Multitask Language Understanding (MMLU), ранее считавшийся сложным, теперь не отражает реальный уровень развития передовых систем.

Разработка нового теста для ИИ

Для решения этой проблемы международная команда из почти тысячи специалистов, включая представителей Техасского университета A&M, создала новый тип экзамена — Humanity's Last Exam (HLE). Этот тест состоит из 2500 вопросов, охватывающих математику, гуманитарные и естественные науки, древние языки и специализированные академические дисциплины. Экзамен был разработан так, чтобы включать задания, с которыми современные ИИ-системы пока не справляются. Подробная информация о проекте опубликована в журнале Nature и на сайте lastexam.ai.

Особенности Humanity's Last Exam

В создании и доработке вопросов принимали участие эксперты из разных областей. Каждый вопрос был тщательно сформулирован, чтобы иметь однозначный и проверяемый ответ, а также чтобы его нельзя было быстро решить с помощью простого поиска в интернете. Темы заданий включают перевод древних надписей, идентификацию анатомических структур у птиц и анализ особенностей произношения библейского иврита.

Процесс отбора вопросов

Каждый вопрос тестировался на ведущих ИИ-системах. Если какая-либо модель могла правильно ответить на вопрос, он исключался из финального экзамена. Такой подход позволил создать тест, который остается сложнее того, что современные ИИ могут надежно решить.

Результаты тестирования

Первые испытания показали, что даже самые мощные ИИ-модели испытывают трудности с этим экзаменом. Например, GPT-4o набрал 2,7%, Claude 3.5 Sonnet — 4,1%, OpenAI o1 — 8%. Наиболее продвинутые системы, такие как Gemini 3.1 Pro и Claude Opus 4.6, достигли точности от 40% до 50%.

Необходимость новых тестов

Высокие баллы на тестах, изначально созданных для людей, не всегда свидетельствуют о настоящем интеллекте ИИ. Такие тесты в основном измеряют способность выполнять конкретные задачи, а не глубину понимания. Без точных инструментов оценки разработчики и пользователи могут неправильно интерпретировать возможности ИИ-систем. Бенчмарки необходимы для объективного измерения прогресса и выявления рисков.

Долгосрочная цель и структура теста

Humanity's Last Exam задуман как устойчивый и прозрачный инструмент для оценки будущих ИИ-систем. Для предотвращения заучивания ответов моделями часть вопросов опубликована, а большинство остаётся скрытыми.

Международное сотрудничество

Проект объединил экспертов из разных стран и дисциплин, включая специалистов по компьютерным наукам, истории, физике, лингвистике и медицине. Такое разнообразие позволило выявить пробелы современных ИИ-систем и подчеркнуло важность человеческой экспертизы в создании сложных задач.

Значение теста

Humanity's Last Exam не ставит целью заменить человека или создать угрозу, а служит инструментом для объективной оценки границ искусственного интеллекта. Экзамен подчеркивает, что несмотря на технологический прогресс, существует значительный разрыв между возможностями ИИ и человеческим интеллектом, а человеческая экспертиза по-прежнему играет ключевую роль.

#искусственный_интеллект#тестирование#природа#бенчмарки#оценка#Humanitys_Last_Exam
0 —

Комментарии (0)

Горячее

Qnap анонсировала новые NAS для видеопроизводства

2 окт. 2026 г.02.10.2026 · 0 реакций

Tesla открыла кредитные линии на $30 млрд

2 окт. 2026 г.02.10.2026 · 0 реакций

Авиаперевозки растут, но новые правила усложняют рынок

1 окт. 2026 г.01.10.2026 · 0 реакций
Рекомендуемое
Облачные вычисления

Qnap анонсировала новые NAS для видеопроизводства

Qnap представила три новые NAS-системы, ориентированные на задачи видеопроизводства и оснащённые портами USB4 для высокой скорости передачи данных. Устройства поддерживают различные режимы подключения и рассчитаны на использование жёстких дисков и SSD большой ёмкости.

Финансовый анализ

Tesla открыла кредитные линии на $30 млрд

Tesla открыла кредитные линии на 30 миллиардов долларов для финансирования крупных инвестиций на фоне снижения прибыли и роста капитальных затрат. Новое соглашение расширяет финансовые возможности компании в условиях давления на бизнес.

Транспортная логистика

Авиаперевозки растут, но новые правила усложняют рынок

Авиаперевозки становятся всё более важной частью логистики, особенно на фоне нестабильности морских перевозок. Однако новые правила оформления авианакладных создают дополнительные сложности и риски для участников рынка.