Полный список материалов издания — 152 публикаций. Страница помогает быстро найти нужный материал и ускоряет обход сайта поисковыми роботами.
- SPHINX: Искусственная среда для визуального восприятия
- Расширение семейства моделей Gemini 2.5
- Ускорение блоков видео: обучение без ускорения генерации
- ТОП-5 материалов о больших языковых моделях
- Gemini Robotics: Искусственный интеллект для роботов
- RAISECity: Многофункциональная платформа для 3D генерации городов
- Harmony: Синхронизация аудио и видео через синергию задач
- Дистилляция без изображений через непрерывную консистентность
- Мультимодальная оценка архитектур для русского языка
- UniGame: Как создать собственного противника для модели
- Укрепление действий с помощью предсказаний
- Сложность идеального выравнивания ИИ: формализация трилеммы RLHF
- NAF: Увеличение разрешения без обучения с помощью внимания соседей
- G^2VLM: Модель языка с геометрической основой для 3D-реконструкции
- MIRA: Многофункциональный агент для редактирования изображений
- Multi-Crit: Оценка мультимодальных судей по множественным критериям
- Агентный обучающийся с мультимодальной семантической памятью
- Canvas-to-Image: Генерация изображений с мультимодальным контролем
- Модели генерации видео как эффективные модели вознаграждения
- Что значит понимать язык?
- ENACT: Оценка воплощённого познания через моделирование мира
- Извлечение моносемантических концепций в системах рекомендаций
- MIST: Оценка взаимной информации с помощью обучения
- AICC: Улучшение извлечения HTML для AI с помощью MinerU-HTML
- MSRNet: Многоуровневая Рекурсивная Сеть для Обнаружения Камуфляжа
- Стабильность представления правды в больших языковых моделях
- Upsample Anything: Новый подход к увеличению разрешения
- EvoVLA: Модель с саморазвивающимся зрением и действиями
- One4D: Единый подход к 4D генерации и реконструкции
- Новый подход к оценке: Открытые вопросы для моделей языка
- Изображение как награда: Обучение с подкреплением в генерации
- Унифицированная генерация молекул с помощью нейронных полей
- SteadyDancer: Анимация человека с сохранением первого кадра
- GigaWorld-0: Модель мира как движок данных для ИИ
- Технический отчет о HunyuanOCR: новое слово в OCR
- iMontage: Унифицированная система генерации изображений
- PhysChoreo: Генерация видео с физическим контролем
- Fara-7B: Эффективная модель для работы с компьютером
- MedSAM-3: Новая модель сегментации медицинских изображений
- Влияние понимания на генерацию в унифицированных мультимодальных моделях
- Масштабирование агентного обучения с инструментами в VLMs
- Agent0-VL: Исследование саморазвивающегося агента для ВЛР
- ReDirector: Создание видеоперезаписей любой длины
- UltraViCo: Преодоление ограничений экстраполяции в видео трансформерах
- VQ-VA World: Новый подход к визуальному вопросно-ответному взаимодействию
- Мягкая адаптивная оптимизация политики в обучении с подкреплением
- DiffSeg30k: Новая база для обнаружения редактирования AIGC
- GigaEvo: Открытая оптимизационная платформа на основе LLM и эволюционных алгоритмов
- MajutsuCity: Генерация 3D городов на основе языка и эстетики
- SciEducator: Многоагентная система для понимания научных видео
- Yo’City: Персонализированная генерация 3D-городов
- OmniAlpha: Унифицированная модель для генерации RGBA-изображений
- SSA: Спарсное внимание для обработки длинных контекстов
- Когнитивные основы рассуждений и их проявление в LLMs
- Будущее распределено неравномерно: как LLM предсказывают события
- Совместная готовка и уборка: обучение агентов для выполнения задач
- MagicWorld: Интерактивное исследование видео миров
- Разнообразная генерация видео с помощью DPP и GRPO
- Улучшение предобучения языковых моделей с помощью выборки
- Инновации в настольном теннисе: оценка траектории и вращения
- STARFlow-V: Генерация видео с помощью нормализующих потоков
- CLaRa: Новый подход к извлечению и генерации информации
- ROOT: Надежный ортогонализированный оптимизатор для НС
- Визуальное Мышление и Текстовое Рассуждение: Синергия Визии и Языка
- Nemotron-Parse-1.1: Новый уровень распознавания текста
- Inferix: Новое поколение движка для моделирования миров
- Совпадение терминальной скорости в генеративном моделировании
- Monet: Рекомендации по визуальному мышлению за пределами изображений
- Скрытое сотрудничество в многократных агентных системах
- Обобщение моделей на разных уровнях сложности задач
- Регуляризация адаптивной резкости для улучшения 3D-сплаттинга
- Создание синтетических данных для обнаружения запрещенных предметов
- Rethinking Saliency Maps: A Cognitive Human Aligned Taxonomy and Evaluation Framework for Explanations
- Изучение внутреннего измерения текстов: от научного абстракта до творчества
- Снижение интеллекта: изучение ограничений восприятия в моделях
- Разнообразие в визуальных авторегрессионных моделях
- Loomis Painter: Восстановление процесса живописи
- Анализ процесса рецензирования на ICLR 2024 и 2025 годов
- MergeDNA: Моделирование генома с учетом контекста
- InstructMix2Mix: Редактирование изображений с разных ракурсов
- Обучение моделей на платформе AMD: вычисления и системный дизайн
- M3-Bench: Оценка мультимодального использования инструментов
- Агенты для работы с компьютером как судьи в разработке интерфейсов
- Общая агентная память через глубокие исследования
- PRInTS: Моделирование вознаграждений для поиска информации
- Эффективное масштабирование агентов с учетом бюджета инструментов
- DeCo: Эффективная диффузия пикселей для генерации изображений
- Инструкции в видео: визуальные сигналы для управления
- Контролируемая декомпозиция слоев для генерации изображений
- AutoEnv: Автоматизированные среды для обучения агентов
- Plan-X: Генерация видео с помощью семантического планирования
- UltraFlux: Совместный дизайн данных и модели для генерации 4K изображений
- Target-Bench: Модели мира и планирование без карт
- SyncMV4D: Моделирование взаимодействия рук и объектов в 4D
- Дистилляция карт потока без использования данных
- Технический отчет HunyuanVideo 1.5: мощная генерация видео
- Chain-of-Visual-Thought: Как улучшить восприятие VLMs
- Pillar-0: Новый этап в моделях радиологии
- MASS: Пространственно-временное понимание для моделей VLM
- DR Tulu: Обучение с подкреплением для глубоких исследований
- Тестовая статья о автоматизации с помощью ИИ
- Автоматизация Chaos Engineering с помощью LLM: Резильентные системы
- VIDEOP2R: Понимание видео от восприятия до рассуждений
- MHR: Параметрическая модель человеческого тела
- Kandinsky 5.0: Модели для генерации изображений и видео
- FreeAskWorld: Интерактивный симулятор для эмбеддед ИИ
- Оценка способностей видео-моделей к рассуждению через задачи лабиринта
- Сегментация поражений на рентгеновских снимках легких
- VisPlay: Саморазвивающиеся модели визуального языка
- ARC-Chapter: Как структурировать длинные видео в главы
- Согласование генеративной музыки ИИ с человеческими предпочтениями
- Medal S: Модель для медицинской сегментации с текстовыми подсказками
- Mixture of States: Новая парадигма для многомодальной генерации
- Как стать эффективным исследователем ИИ: роль разнообразия идей
- RoMa v2: Улучшенное сопоставление признаков для изображений
- Nemotron Elastic: Эффективные Модели Для Различных Задач
- SAM 3D: Реконструкция 3D-объектов из изображений
- PartUV: Упрощённое UV-развёртывание 3D-моделей
- V-ReasonBench: Единый стандарт оценки моделей генерации видео
- MiMo-Embodied: Технический отчет о первом кросс-объединенном модели
- Видео как ответ: предсказание и генерация событий с VANS
- SAM2S: Сегментация объектов в хирургических видео
- Роль первого кадра в настройке видео-контента
- Технический отчет по модели Step-Audio-R1
- Интеграция текстового мышления в визуальную генерацию
- NaTex: Новая генерация текстур с помощью диффузии цвета
- Масштабирование пространственного интеллекта с помощью моделей
- TurkColBERT: Оценка моделей для поиска информации на турецком
- SRPO: Оптимизация самоссылающейся политики для VLA моделей
- Создание и уточнение с помощью визуальных экспертов
- BioBench: Новый стандарт для научных ML-бenchmark’ов
- EntroPIC: Метод стабильного долгосрочного обучения LLM
- FinTRec: Трансформеры для персонализированной рекламы в финансах
- Общие модели не подходят для клинических операций в больницах
- Улучшение визуального понимания медицины через многоуровневое обучение
- Agent0: Автономные агенты, развивающиеся без данных
- Планирование с помощью верификации для генерации видео
- GeoVista: Моделирование визуального восприятия для геолокации
- VLA-4D: Новая модель для управления роботами в 4D
- OmniScientist: Эволюция совместной работы людей и ИИ в науке
- Video-R4: Усовершенствование видеоанализа с текстом
- SAM 3: Новый уровень сегментации объектов с концептами
- WorldGen: Создание интерактивных 3D миров из текста
- OpenMMReasoner: Новые горизонты многомодального рассуждения
- O-Mem: Новая система памяти для персонализированных агентов
- RynnVLA-002: Объединенная модель восприятия и действий
- Многоаспектная атака: уязвимости моделей с защитой
- Mantis: Модель для визуального предсказания и действия
- PARROT: Оценка устойчивости к манипуляциям в LLM
- VisMem: Новый подход к улучшению моделей зрительного восприятия
- TimeViper: Гибридная модель для понимания длинных видео
- Автопостинг ИИ-новостей в TG/VK за 60 минут: готовый пайплайн без кода
Другие издания сети
Проект объединяет несколько тематических изданий об искусственном интеллекте и технологиях:
- Ai News — новости индустрии ИИ: релизы моделей, продукты и решения крупных компаний.
- Инструменты искусственного интеллекта — обзоры ИИ-сервисов, каталог инструментов и проекты с открытым кодом.
- ИИ в авто-бизнесе — автомобильные новинки, обзоры, электромобили и технологии в автопроме.