14 сентября 2026 г.
GigaChat 3.5, Claude Sonnet 5, GLM-5, ClawBench: результаты тестов и новшества — 14 сентября 2026
Новые версии GigaChat, Claude и GLM показывают улучшения в агентности и генерации. ClawBench выявляет слабые стороны агентов в реальных сценариях.
GigaChat 3.5 получил режим рассуждений
Sber выпустил обновлённую версию своей языковой модели GigaChat 3.5 с новым режимом reasoning. Этот режим позволяет модели не просто давать готовый ответ, а демонстрировать пошаговый процесс рассуждений, ведущий к решению проблемы. Такое нововведение полезно для сложных задач, когда важно видеть промежуточные шаги анализа и принятия решений.
Источник: finam.ru
Claude Sonnet 5 улучшился в агентных задачах
Anthropic анонсировала новый выпуск Claude Sonnet 5, акцентируя внимание на улучшении выполнения агентных задач. Среди особенностей — лучшее планирование последовательности действий, работа с браузером и терминалом, написание и проверка кода. Однако компания признаёт, что эта версия не является прямой заменой предыдущей модели Opus.
Источник: neurohive.io
GLM-5 стала первой открытой моделью, конкурентной с GPT и Claude
Исследовательская группа Zhipu AI и университет Цинхуа представили GLM-5 — первую открытую модель, способную соперничать с коммерческими моделями вроде GPT и Claude на ряде ключевых метрик. GLM-5 лидирует среди открытых моделей на бенчмарке Artificial Analysis и занимает первые позиции в генерации кода и текста на платформе LMArena.
Источник: neurohive.io
ClawBench показал ограниченные способности ИИ-агентов в реальной жизни
Новый бенчмарк ClawBench протестировал способность ИИ-агентов решать типичные повседневные задачи, такие как бронирование рейса или оформление заказа онлайн. Лучшая модель — Claude Sonnet 4.6 — смогла справиться только с 33% заданий, тогда как на стандартных синтетических бенчмарках показатели достигают 65–75%.
Источник: neurohive.io
ChatGPT Images 2.0 превзошла конкурентов на 242 балла Elo
OpenAI выпустила вторую версию генератора изображений ChatGPT Images 2.0, основанную на архитектуре gpt-image-2. Новый релиз занял первое место по качеству генерации изображений на площадке LM Arena, обогнав ближайших конкурентов на 242 балла Elo. Особенность новой модели — идеальное отображение текста на различных языках и точное выполнение сложных инструкций.
Источник: neurohive.io
Microsoft отвергает идею публичного размещения акций OpenAI
CEO OpenAI Сэм Альтман подтвердил, что компания не планирует размещать акции на бирже в 2026 году. Во время интервью Альтман подчеркнул важность безопасности технологий и выразил сомнения относительно целесообразности выхода на рынок ценных бумаг в условиях текущих рисков.
Источник: theverge.com
Разделение личности и ролей у виртуальных сотрудников упрощает управление рисками
MTS предложила подход Persona–Execution Separation (PES), позволяющий разделить инструкции и поведение виртуальных ассистентов от выполняемых ими функций. Такой подход облегчает контроль над изменениями поведения виртуальных помощников и снижает необходимость постоянной сертификации изменений.
Источник: habr.com
Agents vs Reality: лучшие ИИ-агенты провалили треть реальных задач
На новом бенчмарке ClawBench выяснилось, что даже самые продвинутые ИИ-агенты способны справляться лишь с третью реальных жизненных задач типа бронирования билетов или оформления заказов. Это контрастирует с показателями на искусственных бенчмарках, где успешность достигает 65–75%.
Источник: neurohive.io