
GIFT: глобальная оптимальность пост-тренинга через Gibbs-инициализацию при конечной температуре
GIFT устраняет разрыв между SFT и RL в обучении LRM через Gibbs-инициализацию при конечной температуре, обеспечивая глобальную оптимальность.

GIFT устраняет разрыв между SFT и RL в обучении LRM через Gibbs-инициализацию при конечной температуре, обеспечивая глобальную оптимальность.

Google DeepMind расширил Gemini API: теперь встроенные сервисы можно комбинировать с кастомными функциями через context circulation.

Google Labs развернул Stitch в полноценную AI-платформу для проектирования UI по тексту. Vibe design, голосовое управление, прототипы и MCP-интеграция.

GPT 5.4 в Codex — заметный шаг вперёд по корректности, удобству, скорости и стоимости. Сравнение с Claude, управление контекстом и fast mode.

HarmMetric Eval — бенчмарк для оценки метрик вредоносности LLM. Главный вывод: METEOR и ROUGE-1 превосходят LLM-судей в определении вредоносных ответов.

M3DLayout — мультиисточниковый датасет с 15 080 3D-планировками и 258 тыс. объектов для генерации интерьерных сцен по текстовому описанию.

MARL-Rad — мультиагентный RL-фреймворк для генерации рентгеновских отчётов. Достигает SOTA по клиническим метрикам на MIMIC-CXR и IU X-ray.

NV-Bench — первый бенчмарк для оценки синтеза невербальных вокализаций в выразительном TTS. 1651 референс, 14 категорий, два протокола оценки.

Сетевой бизнес Nvidia вырос до $31 млрд в год, обойдя Cisco. Подразделение на базе Mellanox стало вторым источником выручки после GPU.

Omni IIE Bench — новый бенчмарк для оценки моделей редактирования изображений по тексту с одноповоротными и многоповоротными треками.

ReasoningBank — фреймворк памяти для LLM-агентов, извлекающий стратегии рассуждений из успешного и провального опыта для непрерывной эволюции агентов.

TDMM-LM — фреймворк, объединяющий понимание и анимацию лиц через геометрические токены 3DMM. Датасет Open3DFaceVid, Motion2Language и Language2Motion.

AI-агент Meta опубликовал ошибочный совет, приведший к утечке конфиденциальных данных компании и пользователей. Инцидент получил статус Sev 1.

VisBrowse-Bench: бенчмарк из 169 задач для оценки визуального поиска в мультимодальных browsing-агентах. Лучший результат — 47.6% у Claude-4.6-Opus.

DebateBias-8K — мультиязычный бенчмарк, выявляющий скрытые стереотипы LLM через дебатные промпты. Предвзятость усиливается на низкоресурсных языках.

Xiaomi представила MiMo-V2-Pro — модель с 1T параметров и контекстом 1M токенов. Топ-8 в мире, приближается к Claude Opus 4.6, при цене в 3-5 раз дешевле.

Разбираем YOLOv26 — NMS-Free end-to-end фреймворк от Ultralytics. MuSGD, STAL, ProgLoss и отказ от DFL для детекции объектов на edge-устройствах.

Apple заблокировала обновления Replit и Vibecode в App Store, ссылаясь на правило о выполнении кода. Мера может ударить по конкурентам Xcode.

Как стартап Arena из UC Berkeley стал главным лидербордом LLM на $1,7 млрд. Нейтральность, AI-агенты и будущее бенчмарков в новом выпуске Equity.

Claude Code для десктопа теперь показывает превью приложений, автоматически ревьюит код, исправляет ошибки CI и мержит PR без выхода из приложения.

Рейтинг a16z: CapCut обходит Gemini, Яндекс в топ-10 мобильного ИИ. 40% списка — фоторедакторы и камеры, ByteDance лидирует с пятью продуктами.