OpenAI представила GPT‑6.1 Sol — почти как флагманская GPT‑6 Astra в сложных задачах, но в пять раз дешевле

Компания OpenAI анонсировала ИИ-модель GPT-6.1 Sol, представляющую собой обновление GPT-6 Sol и отличающуюся высокими результатами в агентном программировании, управлении компьютером и профессиональных задачах.
Источник изображений: OpenAI
Это обновление приближает линейку Sol к GPT-6 Astra в решении сложных задач, отличаясь при этом более доступными тарифами — стандартные цены на входные и выходные токены у новой модели в пять раз ниже, чем у Astra: $2 за входные данные и $10 за выходные. Кэшированные входные данные стоят всего $0,10 за 1 млн токенов, что на 95 % ниже стандартной цены входных данных. Это особенно выгодно для агентных задач, когда нужно повторно использовать контекст в нескольких запросах.
OpenAI отметила, что GPT-6.1 Sol значительно превосходит GPT-6 Sol в сложной профессиональной работе: от написания и отладки кода до понимания документов и выполнения многоэтапных бизнес-процессов.
Например, в тесте DeepSWE v1.1, который оценивает решение сложных задач разработки ПО в реальных кодовых базах, GPT-6.1 Sol превзошла лучший результат GPT-6 Sol на 6,4 п. п. при меньших усилиях на рассуждения и меньших затратах.
В тесте GDP.pdf, который измеряет точность ответов моделей на профессиональные вопросы по сложным PDF-документам, используемым в работе специалистами в области финансов, здравоохранения, права и семи других профессиональных сфер, GPT-6.1 Sol превосходит Opus 5.5 с резервными моделями при стоимости более чем вдвое ниже на всех проверенных уровнях усилий на рассуждения.
В тесте AutomationBench, который проверяет, правильно ли агенты выполняют многоэтапные бизнес-процессы, GPT-6.1 Sol при среднем уровне усилий на рассуждения превосходит Opus 5.5 на 2,2 п. п. при затратах примерно втрое ниже, а также на 4,8 п. п. превосходит показатель GPT-6 Sol.
В тесте AutomationBench 1.0.6 агенты ИИ тестируются в сквозных процессах с использованием 47 инструментов в отделах продаж, маркетинга, операционной деятельности, поддержки, финансов и управления персоналом.
В задачах, требующих взаимодействия с компьютерными приложениями (тест OSWorld 2.0), GPT-6.1 Sol превзошла GPT-6 Sol на 7 п. п. при максимальных усилиях на рассуждения и затратах более чем вдвое ниже, отставая от Astra всего на 2,1 п. п. при стоимости примерно в семь раз ниже.
В тесте Terminal-Bench Science 0.1, который оценивает научные рабочие процессы, включая анализ данных, моделирование и доказательство теорем, GPT-6.1 Sol более чем вдвое превзошла результат GPT-6 Sol при максимальных усилиях на рассуждения и стоимости более чем вдвое ниже. В этом тесте агенты выполняют научно-исследовательские задачи с помощью кода и инструментов терминала: анализируют данные, запускают симуляции и подбирают параметры моделей.
GPT-6.1 Sol также превосходит предшественника по фактической точности ответов на сложные запросы. При очень высоком уровне усилий на рассуждения частота фактических ошибок у неё составляет 4,1 % против 4,5 % у GPT-6 Sol, приближаясь к 4,0 % у Astra при той же настройке. При этом стоимость выполнения примерно на 83 % ниже, чем у Astra.
В тестах на соответствие человеческим намерениям и ценностям GPT-6.1 Sol продемонстрировала значительные улучшения по сравнению с GPT-6 Sol. В сложных тестах модель реже, чем GPT-6 Sol, допускает сбои: скрывает неисправность инструментов поиска, нарушает явные ограничения или совершает несанкционированные действия при выполнении агентных задач. Также не было зафиксировано попыток модели обойти автоматическую систему проверки безопасности.
GPT-6.1 Sol уже доступна всем пользователям Plus, Pro, Business, Enterprise и Edu в рамках ChatGPT Work и Codex. А вот в обычном чате ChatGPT новая модель пока недоступна, но вероятно появится в скором времени.
Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.