Новый набор данных MMLU-Pro для оценки возможностей и производительности больших языковых моделей.

 TIGER-Lab Introduces MMLU-Pro Dataset for Comprehensive Benchmarking of Large Language Models’ Capabilities and Performance

Оценка моделей искусственного интеллекта, в частности больших языковых моделей (LLM), является быстро развивающейся областью исследований.

Исследователи фокусируются на разработке более строгих бенчмарков для оценки возможностей этих моделей в широком спектре сложных задач. Это необходимо для продвижения технологии искусственного интеллекта, поскольку предоставляет понимание сильных и слабых сторон различных систем ИИ. Понимая эти аспекты, исследователи могут принимать обоснованные решения по улучшению и совершенствованию этих моделей.

Оценка LLM: проблемы и решения

Одной из основных проблем в оценке LLM является недостаточность существующих бенчмарков в полной мере отражать возможности моделей. Традиционные бенчмарки, такие как оригинальный набор данных Massive Multitask Language Understanding (MMLU), часто не обеспечивают всестороннюю оценку. Эти бенчмарки обычно включают ограниченные варианты ответов и в основном фокусируются на вопросах, не требующих обширного рассуждения. Это подчеркивает необходимость более сложных и всесторонних наборов данных для более точной оценки разнообразных возможностей этих передовых систем ИИ.

Текущие методы оценки LLM, такие как оригинальный набор данных MMLU, предоставляют некоторые идеи, но имеют существенные ограничения. Оригинальный набор данных MMLU включает только четыре варианта ответов на вопрос, что снижает сложность и уменьшает вызов для моделей. Вопросы в основном ориентированы на знания и не требуют глубоких рассуждений, необходимых для всесторонней оценки ИИ. Эти ограничения приводят к неполному пониманию производительности моделей и подчеркивают необходимость улучшенных инструментов оценки.

Новый набор данных MMLU-Pro

Исследователи из TIGER-Lab представили набор данных MMLU-Pro для преодоления этих ограничений. Этот новый набор данных разработан для более строгого и всестороннего бенчмарка для оценки LLM. MMLU-Pro значительно увеличивает количество вариантов ответов с четырех до десяти на каждый вопрос, увеличивая сложность и реализм оценки. Включение большего количества вопросов, ориентированных на рассуждения, решает недостатки оригинального набора данных MMLU. Этот процесс включает ведущие исследовательские лаборатории по ИИ и академические учреждения с целью установления нового стандарта в оценке ИИ.

Конструкция набора данных MMLU-Pro включала тщательный процесс, чтобы обеспечить его надежность и эффективность. Исследователи начали с фильтрации оригинального набора данных MMLU, чтобы сохранить только самые сложные и актуальные вопросы. Затем они увеличили количество вариантов ответов с четырех до десяти, используя GPT-4, передовую модель ИИ. Этот процесс не ограничивался простым добавлением вариантов ответов; он включал генерацию правдоподобных отвлекающих вариантов, требующих дискриминационных рассуждений для навигации. В набор данных использовались вопросы из высококачественных сайтов по STEM, наборов данных вопросов и ответов на основе теорем и экзаменов по научным дисциплинам уровня колледжа. Каждый вопрос прошел тщательный анализ более чем десятью экспертами для обеспечения точности, справедливости и сложности, делая MMLU-Pro надежным инструментом для бенчмаркинга.

Набор данных MMLU-Pro использует десять вариантов ответов на каждый вопрос, что снижает вероятность случайного угадывания и значительно увеличивает сложность оценки. Включение большего количества проблем уровня колледжа в различных дисциплинах обеспечивает надежный и всесторонний бенчмарк. Набор данных менее чувствителен к различным подсказкам, улучшая его надежность. Хотя 57% вопросов взяты из оригинального набора данных MMLU, они были тщательно отфильтрованы для повышенной сложности и актуальности. Каждый вопрос и его варианты ответов прошли тщательный анализ более чем десятью экспертами с целью минимизации ошибок. Без использования цепочки рассуждений (CoT) лучшая модель, GPT-4o, достигает только 53% показателя.

Производительность различных моделей ИИ на наборе данных MMLU-Pro была оценена, что показало значительные различия по сравнению с исходными показателями MMLU. Например, точность GPT-4 на MMLU-Pro составила 71,49%, что существенно ниже, чем его исходный показатель MMLU в 88,7%. Это снижение на 17,21% подчеркивает увеличенную сложность и надежность нового набора данных. Другие модели, такие как GPT-4-Turbo-0409, снизили свою производительность с 86,4% до 62,58%, а производительность Claude-3-Sonnet снизилась с 81,5% до 57,93%. Эти результаты подчеркивают сложность набора данных MMLU-Pro, требующую более глубоких рассуждений и навыков решения проблем.

В заключение, набор данных MMLU-Pro представляет собой переломный шаг в оценке ИИ, предлагая строгий бенчмарк, который вызывает LLM сложными вопросами, ориентированными на рассуждения. Увеличение количества вариантов ответов и включение разнообразных наборов задач делает MMLU-Pro более точным инструментом для оценки возможностей ИИ. Заметное снижение производительности моделей, таких как GPT-4, подчеркивает эффективность набора данных в выявлении областей для улучшения. Этот всесторонний инструмент оценки необходим для продвижения будущих достижений в области ИИ, позволяя исследователям совершенствовать производительность LLM.

Применение искусственного интеллекта в бизнесе

Если вы хотите использовать искусственный интеллект для развития своей компании и оставаться в числе лидеров, обратитесь к TIGER-Lab Introduces MMLU-Pro Dataset for Comprehensive Benchmarking of Large Language Models’ Capabilities and Performance. Проанализируйте, как ИИ может изменить вашу работу, определите области применения автоматизации и ключевые показатели эффективности, которые вы хотите улучшить с помощью ИИ. Подберите подходящее решение и внедряйте его постепенно, начиная с малого проекта и анализируя результаты и KPI. На основе полученных данных и опыта расширяйте автоматизацию.

Если вам нужны советы по внедрению ИИ, пишите нам на https://t.me/flycodetelegram. Попробуйте ИИ ассистент в продажах https://flycode.ru/aisales/. Этот ИИ ассистент в продажах помогает отвечать на вопросы клиентов, генерировать контент для отдела продаж и снижать нагрузку на первую линию.

Узнайте, как ИИ может изменить ваши процессы с решениями от Flycode.ru.

Мобильная разработка на заказ и готовые решения

Мобильная разработка

Готовые и индивидуальные решения

Веб решения - разработка сайтов и сервисов

Web решения

Получите бесплатную консультацию по веб-разработке прямо сейчас

Аутсорсинг, подбор специалистов и команд разработки

Аутсорсинг

Выберите своего специалиста сегодня и начните свой проект

Новости

  • Itinai.com it company office background blured photography by 392d7806 596c 4c64 a1ae 56d85025c3f2 1

    Переосмысляем токсичные данные в обучении LLM для повышения управляемости и детоксикации

    Практические бизнес-решения для улучшения языковых моделей Эффективность больших языковых моделей (LLMs) зависит от качества их обучающих данных. Удаление токсичных данных может снизить количество вредного контента, но важно найти баланс между безопасностью и производительностью…

  • Itinai.com it company office background blured photography by 93e48de1 e0a4 4327 bf1a 5249ee257f75 2

    Агентный ИИ: Стратегия для Автономных Систем

    Agentic AI: Преобразование бизнес-операций Введение в Agentic AI Agentic AI представляет собой новую эволюцию в автоматизации бизнеса, позволяя системам принимать автономные решения и взаимодействовать с контекстом. Это меняет подход организаций к функционированию, переходя…

  • Itinai.com it company office background blured photography by 12fe5e49 d0a5 47b8 a36f 0071089d22c3 3

    Улучшение использования инструментов ИИ в бизнесе с помощью обучения с подкреплением

    Практические бизнес-решения для улучшения больших языковых моделей Интеграция внешних инструментов с большими языковыми моделями (LLMs) становится все более популярной в сфере ИИ. Это открывает новые возможности для бизнеса. Вот как можно улучшить бизнес-процессы…

  • Itinai.com it company office background blured photography by c2deb05c 8496 4a4d 8cab 2bb3d57fc0f0 1

    Развертывание MCP-сервера на базе Firecrawl для бизнес-приложений

    Внедрение полностью интегрированного сервера MCP на базе Firecrawl Данное руководство поможет вам настроить полностью функциональный сервер Model Context Protocol (MCP) с использованием Smithery для конфигурации и VeryaX для оркестрации в реальном времени. Следуя…

  • Itinai.com it company office background blured photography by 12fe5e49 d0a5 47b8 a36f 0071089d22c3 0

    Внедрение LLM-агента с доступом к инструментам с использованием MCP-Use

    Практические бизнес-решения с использованием LLM-агента Внедрение LLM-агента с доступом к инструментам через MCP-Use может значительно улучшить бизнес-процессы и повседневную жизнь. Вот как это может помочь: Улучшение взаимодействия с клиентами Создание чат-бота позволяет автоматизировать…

  • Itinai.com it company office background blured photography by 0b545732 d29f 4839 a448 751a77ba1563 2

    Улучшение ИИ: Объединение Размышлений и Проверки с Помощью RLV

    Практические бизнес-решения для улучшения работы с ИИ Понимание обучения с подкреплением в языковых моделях Большие языковые модели (LLM) значительно улучшили свои способности к рассуждению благодаря методу обучения с подкреплением (RL). Этот подход вознаграждает…

  • Itinai.com it company office background blured photography by 93e48de1 e0a4 4327 bf1a 5249ee257f75 0

    Запуск HealthBench: Новый стандарт оценки ИИ в здравоохранении

    Введение в HealthBench HealthBench — это опенсорсная платформа для оценки производительности ИИ в здравоохранении, разработанная OpenAI. Она позволяет улучшить взаимодействие между ИИ и медицинскими работниками, обеспечивая более точные и безопасные результаты. Проблемы в…

  • Itinai.com it company office background blured photography by c2deb05c 8496 4a4d 8cab 2bb3d57fc0f0 1

    Продвижение многомодального ИИ: практические бизнес-решения

    Понимание многомодального ИИ Искусственный интеллект (ИИ) значительно расширился за пределы традиционных систем обработки языка. Сегодня существуют модели, которые могут обрабатывать различные типы входных данных, включая текст, изображения, аудио и видео. Эта область, известная…

  • Itinai.com it company office background blured photography by d266ecb7 1141 4fd8 a45e d7242fbf1e9e 0

    Создайте и опубликуйте свой AI-блог с Lovable.dev и интеграцией GitHub

    Практические бизнес-решения с использованием искусственного интеллекта Как это улучшает бизнес и реальную жизнь Создание блога с помощью Lovable.dev позволяет компаниям быстро и эффективно запустить онлайн-присутствие. Это улучшает видимость бренда, привлекает клиентов и увеличивает…

  • Itinai.com it company office background blured photography by 41bad236 c948 453e 803a 7165a764e0bf 1

    StreamBridge: Преобразование Видео-LLMs для Реального Времени

    Бизнес-Трансформация с помощью Искусственного Интеллекта Понимание Ограничений Video-LLMs Video-LLMs предназначены для анализа записанных видео. Однако, такие отрасли, как робототехника и автономное вождение, требуют понимания видео в реальном времени. Это создает значительные трудности, так…

  • Itinai.com it company office background blured photography by b78d385e b261 4424 829c 8c380ea5040f 1

    Запуск INTELLECT-2: Децентрализованная модель рассуждений с 32 миллиардами параметров

    Проблемы централизованного обучения ИИ Традиционные методы централизованного обучения сталкиваются с ограничениями из-за высокой стоимости вычислительных кластеров и нехватки ресурсов. Это затрудняет эксперименты и сотрудничество в исследованиях. Децентрализованные решения Переход к децентрализованным методам обучения…

  • Itinai.com it company office background blured photography by 392d7806 596c 4c64 a1ae 56d85025c3f2 1

    AG-UI: Революция в Реальном Времени для Взаимодействия AI и Front-End Приложений

    AG-UI: Упрощение Взаимодействия с ИИ в Реальном Времени Современные достижения в области искусственного интеллекта значительно улучшили автоматизацию задач, таких как суммирование, миграция данных и планирование. Однако, чтобы повысить эффективность бизнеса, необходимо внедрить решения,…

  • Itinai.com it company office background blured photography by 392d7806 596c 4c64 a1ae 56d85025c3f2 1

    Аудио-SDS: Новый Подход к Синтезу Звука с Использованием ИИ

    Понимание Audio-SDS: Новый подход к синтезу аудио Введение в модели диффузии аудио Модели диффузии аудио значительно продвинулись в создании качественной речи, музыки и звуковых эффектов. Однако их основная сила заключается в генерации образцов,…

  • Itinai.com it company office background blured photography by 342dc52c d1e8 48a5 a450 02825b0d4c2b 0

    Эффективный размер состояния: новая метрика для оптимизации памяти в последовательных моделях

    Практические бизнес-решения с использованием Effective State-Size (ESS) Использование метрики Effective State-Size (ESS) в последовательных моделях может значительно улучшить производительность бизнеса и повысить эффективность работы. Вот шаги, которые помогут внедрить эту метрику в вашу…

  • Itinai.com it company office background blured photography by b78d385e b261 4424 829c 8c380ea5040f 2

    Запуск GTE-ModernColBERT-v1: Продвинутый Семантический Поиск для Длинных Документов

    Практические бизнес-решения Для компаний, стремящихся внедрить решения на основе ИИ, рассмотрите следующие шаги: 1. Определите возможности автоматизации Ищите процессы, которые можно автоматизировать для повышения эффективности. Это может включать в себя обработку запросов клиентов,…

  • Itinai.com it company office background blured photography by 12fe5e49 d0a5 47b8 a36f 0071089d22c3 3

    Ускорение аннотирования активного обучения с Adala и Google Gemini

    Использование ИИ для классификации медицинских симптомов Введение Компании могут использовать фреймворк Adala и Google Gemini для создания эффективного процесса активного обучения, который поможет в классификации медицинских симптомов. Это улучшит процессы аннотирования данных и…

  • Itinai.com it company office background blured chaos 50 v b3314315 0308 4954 a141 47b85163297e 2

    PrimitiveAnything: Инновационная AI-платформа для 3D-реконструкции форм

    Практические бизнес-решения с использованием PrimitiveAnything Преобразование 3D-форм через простые геометрические фигуры открывает новые возможности для повышения эффективности в различных секторах. Вот как можно внедрить эти технологии в бизнес. Шаг 1: Понимание абстракции форм…

  • Itinai.com it company office background blured photography by 342dc52c d1e8 48a5 a450 02825b0d4c2b 0

    Создание чат-бота с памятью на основе Claude и Mem0

    Практические бизнес-решения с использованием AI Внедрение AI с памятью, используя Claude и Mem0, может значительно улучшить взаимодействие с клиентами и повысить эффективность бизнеса. Вот как это можно реализовать: 1. Установка окружения Установите необходимые…