Как синтетические доказательства меняют возможности системы LLM

«`html

Революционное доказательство теорем: как синтетические доказательства изменяют возможности LLM

Доказательные ассистенты, такие как Lean, обеспечивают высокую точность в математических доказательствах, решая растущую сложность современной математики, которая часто приводит к ошибкам. Формальные языки, такие как Lean, Isabelle и Coq, создают компьютерно-проверяемые доказательства, но требуют значительных усилий и экспертизы. Автоматизированное доказательство теорем становится все более важным, с новыми методами, фокусирующимися на алгоритмах поиска потенциальных решений. Несмотря на улучшения в LLM, этим методам требуется больше обучающих данных. Продвижение в автоформализации предлагает определенное облегчение, но наборы данных остаются слишком маленькими, чтобы полностью использовать возможности LLM.

Практические решения и ценность

Исследователи из DeepSeek, Университета Сунь Ят-сен, Университета Эдинбурга и MBZUAI разработали метод генерации обширных данных доказательств LFourfour из задач математических соревнований старших классов и студентов. Путем перевода этих задач в формальные утверждения, фильтрации низкокачественных и генерации доказательств они создали набор данных из 8 миллионов утверждений. Путем настройки модели DeepSeekMath 7B на этих данных им удалось достичь точности 46,3% в генерации полного доказательства на тесте Lean 4 miniF2F, превзойдя 23,0% у GPT-4. Их модель также решила 5 из 148 задач бенчмарка FIMO, превзойдя GPT-4. Эта работа продвигает доказательство теорем путем использования синтетических данных большого масштаба.

Автоматизированное доказательство теорем (ATP) является ключевой областью исследований в области искусственного интеллекта с момента своего возникновения. Оно развилось от эффективных доказателей первого порядка, таких как E и Vampire, к обработке сложных теорем в современных доказательственных ассистентах, таких как Lean, Isabelle и Coq. Недавние успехи в глубоком обучении и модельно-управляемом поиске возродили ATP, объединяя нейронные модели с алгоритмами поиска в дереве и обучением с подкреплением. Эти методы, хотя и мощные, требуют больших ресурсов. Автоформализация, преобразование естественного языка в формальные утверждения, решает проблему ограниченных обучающих данных. Недавние усилия синтезируют большие наборы формальных доказательств, используя LLM, чтобы значительно улучшить производительность нейронных доказателей на сложных математических задачах.

Подход включает четыре основных этапа. Формальные математические утверждения изначально генерируются из большой коллекции неформальных математических задач. Эти автоформализованные утверждения проходят фильтрацию через оценку модели и отклонение гипотез для выбора высококачественных. Затем модель DeepSeek-Prover пытается доказать эти утверждения с проверкой корректности с помощью формального верификатора Lean 4, что приводит к подтвержденным формальным утверждениям и доказательствам. Эти данные используются для настройки модели DeepSeek-Prover, и процесс повторяется, пока улучшения не станут незначительными. Для улучшения эффективности доказательства одновременно доказываются как исходные утверждения, так и их отрицания, быстро отбрасывая недопустимые утверждения.

DeepSeek-Prover, основанный на модели DeepSeekMath-Base 7B, был настроен с глобальным размером пакета 512 и постоянной скоростью обучения 1 × 10^−4, включая 6 000 шагов разогрева с использованием синтетических данных. Его производительность была сравнена с GPT-3.5, GPT-4 и несколькими передовыми методами, такими как GPT-f, Proof Artifact Co-Training, ReProver, Llemma и COPRA. Оценки на бенчмарках miniF2F и FIMO показали, что DeepSeek-Prover превзошел другие, достигнув 60,2% на miniF2F-valid и 52,0% на miniF2F-test, значительно превышая 25,41% и 22,95% у GPT-4. Бенчмарк FIMO успешно доказал пять теорем с разными попытками, превзойдя GPT-4, который не смог установить ни одной.

В заключение, исследование разработало метод генерации обширных синтетических доказательств из задач математических соревнований старших классов и студентов. Путем перевода задач на естественном языке в формальные утверждения, фильтрации низкокачественных данных и использования итеративного доказательства было создано 8 миллионов доказательств, значительно улучшающих производительность модели DeepSeekMath 7B в автоматизированном доказательстве теорем. Модель превосходит GPT-4 и другие бенчмарки, такие как miniF2F и FIMO. Открытые наборы данных и модель направлены на продвижение исследований в области автоматизированного доказательства теорем и улучшение возможностей крупных языковых моделей в формальном математическом рассуждении, с планами расширения области решаемых математических проблем в будущих работах.

«`

IT решения FlyCode

Новости

20.05.2025

AI News

Meta запускает KernelLLM: Эффективная генерация GPU-ядр

Преобразование GPU-программирования с помощью KernelLLM Обзор KernelLLM KernelLLM от Meta — это продвинутая языковая модель, которая упрощает разработку GPU-ядр. С 8 миллиардами параметров, она позволяет разработчикам сосредоточиться на оптимизации производительности, избавляя их от…
20.05.2025

AI News

Эффективная настройка Qwen3-14B с Unsloth AI на Google Colab

Практическое руководство по тонкой настройке Qwen3-14B с использованием Unsloth AI Введение Тонкая настройка больших языковых моделей, таких как Qwen3-14B, может быть трудоемкой. Unsloth AI предлагает упрощенный подход, который снижает использование ресурсов. Это руководство…
20.05.2025

AI News

Запуск мобильного приложения NotebookLM от Google: революция в исследованиях

Введение Приложение NotebookLM от Google — это революционный шаг в области исследований, предлагающий пользователям доступ к персонализированным инструментам для работы с контентом. Ключевые особенности NotebookLM 1. Улучшенный контекстный ИИ NotebookLM использует модель Gemini…
20.05.2025

AI News

UAEval4RAG: Новый стандарт оценки систем RAG для отказа от неразрешимых запросов

Улучшение оценки ИИ с помощью UAEval4RAG Исследователи Salesforce представили новую структуру под названием UAEval4RAG, разработанную для улучшения оценки систем Retrieval-Augmented Generation (RAG). Эта структура фокусируется на способности систем отклонять запросы, на которые нельзя…
20.05.2025

AI News

Агентный ИИ в финансовых услугах: возможности и риски

Возможности Agentic AI в финансовых услугах Введение в Agentic AI Agentic AI — это продвинутые программные системы, способные автономно принимать решения и планировать. Эти системы отличаются от традиционных автоматизированных инструментов и чат-ботов, используя…
20.05.2025

AI News

Ограничения методов интерпретации ИИ: результаты исследования Anthropic

Понимание разъяснений ИИ: Практические бизнес-решения Введение в цепочку размышлений Метод цепочки размышлений (CoT) помогает понять, как большие языковые модели (LLM) приходят к своим выводам. Это особенно важно в критически важных областях, таких как…
20.05.2025

AI News

Omni-R1: Прорыв в аудио-вопросах с использованием обучения с подкреплением

Преобразование бизнеса с помощью Omni-R1 Недавние инновации в области искусственного интеллекта показывают, что обучение с подкреплением (RL) может значительно улучшить аналитические способности больших языковых моделей (LLMs). Omni-R1 продвигает аудио-вопросы и ответы, интегрируя текстовое…
20.05.2025

AI News

Эффективный векторный поиск в Azure Cosmos DB от Microsoft

Эффективный поиск векторных данных с помощью Microsoft Azure Cosmos DB Инновационное решение Microsoft Microsoft разработала систему, которая интегрирует возможности векторного поиска непосредственно в Azure Cosmos DB. Это позволяет бизнесу выполнять эффективные поиски по…
19.05.2025

AI News

Критические уязвимости безопасности в Протоколе Контекста Модели (MCP)

Практические бизнес-решения для устранения уязвимостей MCP Модельный контекстный протокол (MCP) предлагает значительные преимущества, но также несет в себе риски безопасности. Вот как можно улучшить бизнес и реальную жизнь, устраняя эти уязвимости. 1. Устранение…
19.05.2025

AI News

Улучшение эффективности поиска с помощью обучения с подкреплением в рамках SEM от Ant Group

Оптимизация использования инструментов и эффективности рассуждений в ИИ Понимание проблемы Недавние разработки в области больших языковых моделей (LLMs) продемонстрировали их способность выполнять сложные задачи рассуждения и использовать внешние инструменты, такие как поисковые системы.…
19.05.2025

AI News

Улучшение принятия решений в бизнесе с помощью обучения с подкреплением

Практические бизнес-решения Недавние достижения в области искусственного интеллекта открывают новые возможности для бизнеса. Вот как можно использовать их для улучшения бизнес-результатов: 1. Определение возможностей автоматизации Ищите процессы, которые можно автоматизировать с помощью ИИ,…
18.05.2025

AI News

Создание Интеллектуальной Системы Вопрос-Ответ на Основе AI

Создание Эффективной Системы Вопрос-Ответ Эта инструкция описывает шаги по созданию мощной системы вопрос-ответ, используя комбинацию передовых технологий. Интеграция API Tavily Search, Chroma, Google Gemini LLM и фреймворка LangChain позволит компаниям улучшить взаимодействие с…
18.05.2025

AI News

Оптимизация программной инженерии с помощью языковых моделей

Оптимизация программной инженерии с помощью языковых моделей Введение в языковые модели Современные достижения в области языковых моделей (LM) показывают их потенциал для автоматизации сложных задач в различных областях, включая программную инженерию. Эти модели…
17.05.2025

AI News

AWS Strands Agents SDK: Упрощение разработки ИИ-агентов

AWS Strands Agents SDK: Преобразование бизнеса с помощью ИИ Amazon Web Services (AWS) открыла доступ к Strands Agents SDK, который упрощает разработку ИИ-агентов. Это решение делает ИИ доступным для различных отраслей, позволяя разработчикам…
17.05.2025

AI News

LightLab: Революция в управлении освещением изображений с помощью ИИ

Введение в LightLab: Новый метод ИИ для управления освещением изображений Исследователи Google в сотрудничестве с несколькими университетами разработали LightLab, передовой метод ИИ, который позволяет точно управлять освещением в изображениях. Это новшество решает проблемы…
17.05.2025

AI News

DeepSeek-V3: Революция в языковом моделировании с повышенной эффективностью

Оптимизация языкового моделирования с помощью DeepSeek-AI Модели, такие как DeepSeek-V3, предлагают инновационные решения для повышения эффективности бизнеса. Вот как они могут улучшить бизнес-процессы и реальную жизнь: Проблемы масштабирования языковых моделей Организации сталкиваются с…
17.05.2025

AI News

Проблемы многоповоротных разговоров в ИИ: снижение производительности на 39%

Понимание Проблем Использования Разговорного ИИ Разговорный ИИ, особенно большие языковые модели (LLMs), направлен на улучшение взаимодействия с пользователями. Однако, исследования показали значительное снижение эффективности—39%—при выполнении многоповоротных разговоров. Значение Контекста в Разговорах Разговорный ИИ…
17.05.2025

AI News

Windsurf представляет SWE-1: Инновационные AI модели для разработки программного обеспечения

Практические бизнес-решения с использованием SWE-1 Модель SWE-1 от Windsurf предлагает ряд инновационных решений для оптимизации процессов разработки программного обеспечения. Эти решения могут значительно улучшить бизнес и повседневную жизнь, обеспечивая более эффективное взаимодействие и…