нейроинструменты

1 сентября 2026 г.

ChatGPT Images 2.0, GLM-5, DeepSeek V4 Flash, антропоморфизм ИИ — 1 сентября 2026

OpenAI обновила генератор изображений, Китай ответил улучшенным LLM, исследование показало слабость ИИ в ролевой игре

OpenAI выпустила ChatGPT Images 2.0 с высоким разрешением и мультиязычной поддержкой

OpenAI анонсировала вторую версию генератора изображений ChatGPT Images 2.0 на базе новой архитектуры gpt-image-2. Согласно рейтингу LM Arena, модель обошла конкурентов на 242 очка Elo благодаря точной обработке сложных инструкций и качественному рендерингу текста на различных языках. Теперь доступна поддержка разрешения до 2К пикселей.

Источник: neurohive.io

GLM-5 стала первой открытой моделью, конкурирующей с закрытыми моделями на агентных задачах

Zhipu AI совместно с университетом Цинхуа представили GLM-5 — открытую языковую модель, лидирующую среди открытых решений на бенчмарке Artificial Analysis и занимающую первые места в генерации кода и текста на платформе LMArena. Модель способна самостоятельно решать комплексные задачи и уверенно работает с внешними инструментами.

Источник: neurohive.io

DeepSeek V4 Flash вышла из бета-версии и показала улучшения в агентных задачах

Китайская компания DeepSeek завершила тестирование версии V4 Flash своего LLM и предоставила официальную точку входа API «0731». Новая модель сохранила параметры предыдущей версии, но заметно улучшилась в выполнении агентных задач, набрав 50 баллов на Artificial Analysis против 40 ранее. Это позволяет ей приблизиться к уровню бюджетных версий GPT-5.6 от OpenAI.

Источник: ai-stat.ru

Исследование выявило слабости больших языковых моделей в ролевых играх

Исследователи из Tencent и Университета Сунь Ятсена изучили способность 17 крупных языковых моделей справляться с заданиями в формате ролевых игр. Выяснилось, что большинство моделей показывают низкие результаты: оценка героев составила 3.21 из 5, а злодеи получили еще меньший балл — 2.61. Основной проблемой стало несоответствие требований игры внутренним ограничениям моделей.

Источник: neurohive.io

Регулирование ChatGPT в ЕС усилилось требованиями к защите детей и психического здоровья

Европейская комиссия объявила, что ChatGPT признан крупным онлайн-сервисом поиска и попадает под действие Директивы о цифровых услугах (DSA). Помимо ChatGPT, статус крупного сервиса присвоен также Reddit и Roblox. Новые правила запрещают целевой рекламе ориентироваться на несовершеннолетних и учитывать такие факторы, как половая ориентация, религиозные убеждения, этническое происхождение или политические взгляды.

Источник: theverge.com

Promt-инъекции: почему нейросети воспринимают отзывы как команды?

Автор поста разобрал феномен promt-инъекций, когда нейросеть интерпретирует фрагменты отзывов как инструкции. Через призму теории речевых актов показано, как ввод посторонней фразы внутрь естественного текста неожиданно активизирует выполнение скрытого запроса. Автор провел эксперимент с моделью Gemini, протестировав разные формы инъекции.

Источник: habr.com

Искусственный интеллект показал слабые результаты на реальных бытовых задачах

Новый бенчмарк ClawBench измеряет способность ИИ-агентов выполнять типичные бытовые задачи вроде бронирования рейса или заказа товара. Лучшая модель — Claude Sonnet 4.6 — смогла решить лишь треть предложенных заданий (33%). Этот результат контрастирует с показателями стандартных тестов, где успех достигает 65–75%.

Источник: neurohive.io

Российское правительство усложняет получение субсидий разработчикам электроники

Минпромторг РФ установил новые требования к получению государственных субсидий производителями электронной техники. Отныне финансирование будут получать проекты, направленные на создание отдельных ключевых компонентов из утверждённого перечня, а не готовых устройств целиком. Таким образом власти стремятся стимулировать развитие отечественной элементной базы и снизить зависимость от импорта.

Источник: ixbt.com