нейроинструменты

15 сентября 2026 г.

GigaChat 3.5, GLM-5, OpenAI Jalapeño, CLAWBENCH — главные новости AI — 15 сентября 2026

GigaChat получил режим рассуждений, GLM-5 обогнала Claude и GPT, OpenAI выпустила собственный чип, ClawBench показал слабые стороны агентов

GigaChat 3.5 Reasoning: новый уровень рассуждений

«Сбер» выпустил обновленную версию своего AI-помощника GigaChat 3.5 с функцией рассуждений. Новинка способна не просто давать ответы, а пошагово обосновывать свое решение. Эта функция полезна для сложных аналитических задач, программирования и научной деятельности.

Источник: finam.ru

GLM-5: первая открытая модель, способная соперничать с Claude и GPT

Zhipu AI и Tsinghua University представили GLM-5 — открытую модель, лидирующую по ряду ключевых метрик. Она превосходит другие open-source модели на Artificial Analysis и показывает лучшие результаты в генерации кода и текста на платформе LMArena. Модель поддерживает инструменты и решает агентные задачи, приближаясь к уровню закрытых продуктов.

Источник: neurohive.io

OpenAI Jalapeño: первые собственные чипы для запуска LLM

OpenAI анонсировала выпуск собственного чипа Jalapeño для обработки больших языковых моделей. Время разработки составило рекордные девять месяцев — значительно быстрее стандартных сроков в три года. Этот шаг позволит компании ускорить обучение и эксплуатацию собственных моделей.

Источник: habr.com

ClawBench: реальный показатель эффективности ИИ-агентов

Новый бенчмарк ClawBench протестировал способность ИИ-агентов справляться с повседневными задачами вроде бронирования билетов и оформления заказов. Лучшая модель смогла решить только треть заданий, тогда как на классических бенчмарках показатели достигают 65–75%.

Источник: neurohive.io

ChatGPT Images 2.0: улучшенная генерация изображений с высоким разрешением

OpenAI выпустила вторую версию своей модели генерации изображений ChatGPT Images 2.0. Новый релиз улучшил качество визуализации текста на различных языках и повысил точность выполнения сложных инструкций. Согласно LM Arena, модель получила значительное преимущество над конкурентами.

Источник: neurohive.io

Claude Sonnet 5: агентный апгрейд, но не замена Opus

Anthropic представила очередную итерацию своей серии Claude — Sonnet 5. Модель оптимизирована для агентных задач, программировании и автоматизации корпоративных процессов. Однако, несмотря на улучшения, она пока не заменяет предыдущую версию Opus по скорости и стоимости.

Источник: neurohive.io

DeepSeek V4.1 Flash: победа открытой модели на агентском бенчмарке

Открытая модель DeepSeek V4.1 Flash опередила закрытую GPT-6 Astra на бенчмарке Artificial Analysis. Несмотря на меньшие ресурсы и доступность широкой публике, DeepSeek продемонстрировала высокую эффективность и скорость выполнения задач.

Источник: ai-stat.ru

Искусственный интеллект играет роли плохо: исследование выравнивания моделей

Исследователи из Tencent и Sun Yat-Sen University изучили способности больших языковых моделей к ролевой игре. Выяснилось, что даже сильные модели показывают низкие результаты: оценка героев достигает лишь 3.21 из 5, а злодеи получают ещё меньше баллов. Причиной является сложность моделирования мотиваций и эмоций персонажей.

Источник: neurohive.io