нейроинструменты

14 сентября 2026 г.

GigaChat 3.5, Claude Sonnet 5, GLM-5, ClawBench: результаты тестов и новшества — 14 сентября 2026

Новые версии GigaChat, Claude и GLM показывают улучшения в агентности и генерации. ClawBench выявляет слабые стороны агентов в реальных сценариях.

GigaChat 3.5 получил режим рассуждений

Sber выпустил обновлённую версию своей языковой модели GigaChat 3.5 с новым режимом reasoning. Этот режим позволяет модели не просто давать готовый ответ, а демонстрировать пошаговый процесс рассуждений, ведущий к решению проблемы. Такое нововведение полезно для сложных задач, когда важно видеть промежуточные шаги анализа и принятия решений.

Источник: finam.ru

Claude Sonnet 5 улучшился в агентных задачах

Anthropic анонсировала новый выпуск Claude Sonnet 5, акцентируя внимание на улучшении выполнения агентных задач. Среди особенностей — лучшее планирование последовательности действий, работа с браузером и терминалом, написание и проверка кода. Однако компания признаёт, что эта версия не является прямой заменой предыдущей модели Opus.

Источник: neurohive.io

GLM-5 стала первой открытой моделью, конкурентной с GPT и Claude

Исследовательская группа Zhipu AI и университет Цинхуа представили GLM-5 — первую открытую модель, способную соперничать с коммерческими моделями вроде GPT и Claude на ряде ключевых метрик. GLM-5 лидирует среди открытых моделей на бенчмарке Artificial Analysis и занимает первые позиции в генерации кода и текста на платформе LMArena.

Источник: neurohive.io

ClawBench показал ограниченные способности ИИ-агентов в реальной жизни

Новый бенчмарк ClawBench протестировал способность ИИ-агентов решать типичные повседневные задачи, такие как бронирование рейса или оформление заказа онлайн. Лучшая модель — Claude Sonnet 4.6 — смогла справиться только с 33% заданий, тогда как на стандартных синтетических бенчмарках показатели достигают 65–75%.

Источник: neurohive.io

ChatGPT Images 2.0 превзошла конкурентов на 242 балла Elo

OpenAI выпустила вторую версию генератора изображений ChatGPT Images 2.0, основанную на архитектуре gpt-image-2. Новый релиз занял первое место по качеству генерации изображений на площадке LM Arena, обогнав ближайших конкурентов на 242 балла Elo. Особенность новой модели — идеальное отображение текста на различных языках и точное выполнение сложных инструкций.

Источник: neurohive.io

Microsoft отвергает идею публичного размещения акций OpenAI

CEO OpenAI Сэм Альтман подтвердил, что компания не планирует размещать акции на бирже в 2026 году. Во время интервью Альтман подчеркнул важность безопасности технологий и выразил сомнения относительно целесообразности выхода на рынок ценных бумаг в условиях текущих рисков.

Источник: theverge.com

Разделение личности и ролей у виртуальных сотрудников упрощает управление рисками

MTS предложила подход Persona–Execution Separation (PES), позволяющий разделить инструкции и поведение виртуальных ассистентов от выполняемых ими функций. Такой подход облегчает контроль над изменениями поведения виртуальных помощников и снижает необходимость постоянной сертификации изменений.

Источник: habr.com

Agents vs Reality: лучшие ИИ-агенты провалили треть реальных задач

На новом бенчмарке ClawBench выяснилось, что даже самые продвинутые ИИ-агенты способны справляться лишь с третью реальных жизненных задач типа бронирования билетов или оформления заказов. Это контрастирует с показателями на искусственных бенчмарках, где успешность достигает 65–75%.

Источник: neurohive.io