SciEducator — первая многоагентная система для понимания научных видео, использующая итеративный подход и создающая мультимодальный образовательный контент.
Метка: Мультимодальность
MajutsuCity — новая платформа для создания 3D городов с управляемыми макетами и объектами на основе языка.
Изучите Monet — метод для визуального мышления с помощью языковых моделей, решающий проблемы обучения и повышения эффективности.
Изучаем влияние снижения мощности LLM на визуальные способности и представляем новый метод Extract+Think.
M3-Bench – первый бенчмарк для оценки мультимодального использования инструментов с многопоточностью и визуальным обоснованием.
Узнайте о Plan-X, фреймворке для генерации видео на основе семантического планирования и о его преимуществах в визуальном синтезе.
Изучите сегментацию поражений на рентгеновских снимках легких с помощью нового подхода ILS и набора данных MIMIC-ILS.
VisPlay — саморазвивающаяся структура для улучшения моделей визуального языка с использованием неразмеченных данных.
Изучите, как модель VANS использует видео для предсказания событий и решения задач, связанных с мультимодальными входами.
Изучите, как Thinking-while-Generating улучшает визуальную генерацию через текстовое рассуждение.