15 сентября 2026 г.
GigaChat 3.5, GLM-5, OpenAI Jalapeño, CLAWBENCH — главные новости AI — 15 сентября 2026
GigaChat получил режим рассуждений, GLM-5 обогнала Claude и GPT, OpenAI выпустила собственный чип, ClawBench показал слабые стороны агентов
GigaChat 3.5 Reasoning: новый уровень рассуждений
«Сбер» выпустил обновленную версию своего AI-помощника GigaChat 3.5 с функцией рассуждений. Новинка способна не просто давать ответы, а пошагово обосновывать свое решение. Эта функция полезна для сложных аналитических задач, программирования и научной деятельности.
Источник: finam.ru
GLM-5: первая открытая модель, способная соперничать с Claude и GPT
Zhipu AI и Tsinghua University представили GLM-5 — открытую модель, лидирующую по ряду ключевых метрик. Она превосходит другие open-source модели на Artificial Analysis и показывает лучшие результаты в генерации кода и текста на платформе LMArena. Модель поддерживает инструменты и решает агентные задачи, приближаясь к уровню закрытых продуктов.
Источник: neurohive.io
OpenAI Jalapeño: первые собственные чипы для запуска LLM
OpenAI анонсировала выпуск собственного чипа Jalapeño для обработки больших языковых моделей. Время разработки составило рекордные девять месяцев — значительно быстрее стандартных сроков в три года. Этот шаг позволит компании ускорить обучение и эксплуатацию собственных моделей.
Источник: habr.com
ClawBench: реальный показатель эффективности ИИ-агентов
Новый бенчмарк ClawBench протестировал способность ИИ-агентов справляться с повседневными задачами вроде бронирования билетов и оформления заказов. Лучшая модель смогла решить только треть заданий, тогда как на классических бенчмарках показатели достигают 65–75%.
Источник: neurohive.io
ChatGPT Images 2.0: улучшенная генерация изображений с высоким разрешением
OpenAI выпустила вторую версию своей модели генерации изображений ChatGPT Images 2.0. Новый релиз улучшил качество визуализации текста на различных языках и повысил точность выполнения сложных инструкций. Согласно LM Arena, модель получила значительное преимущество над конкурентами.
Источник: neurohive.io
Claude Sonnet 5: агентный апгрейд, но не замена Opus
Anthropic представила очередную итерацию своей серии Claude — Sonnet 5. Модель оптимизирована для агентных задач, программировании и автоматизации корпоративных процессов. Однако, несмотря на улучшения, она пока не заменяет предыдущую версию Opus по скорости и стоимости.
Источник: neurohive.io
DeepSeek V4.1 Flash: победа открытой модели на агентском бенчмарке
Открытая модель DeepSeek V4.1 Flash опередила закрытую GPT-6 Astra на бенчмарке Artificial Analysis. Несмотря на меньшие ресурсы и доступность широкой публике, DeepSeek продемонстрировала высокую эффективность и скорость выполнения задач.
Источник: ai-stat.ru
Искусственный интеллект играет роли плохо: исследование выравнивания моделей
Исследователи из Tencent и Sun Yat-Sen University изучили способности больших языковых моделей к ролевой игре. Выяснилось, что даже сильные модели показывают низкие результаты: оценка героев достигает лишь 3.21 из 5, а злодеи получают ещё меньше баллов. Причиной является сложность моделирования мотиваций и эмоций персонажей.
Источник: neurohive.io