Введение
В данной работе рассматривается задача создания «машин, которые могут запоминать», где долгосрочная память представляется как проблема эффективного моделирования ультра-длинного контекста.
Ключевые свойства
Мы утверждаем, что для решения задачи ультра-длинного контекста необходимы три ключевых свойства:
- Разреженность
- Гибкость случайного доступа
- Обобщение по длине
Методы
Для решения задачи моделирования ультра-длинного контекста мы используем иерархическую разреженную внимание (HSA) — новый механизм внимания, который отвечает всем трем указанным свойствам. Мы интегрируем HSA в модели Transformers, создавая HSA-UltraLong, модель с 8 миллиардами параметров, обученную на более чем 8 триллионах токенов.
Результаты
Модель HSA-UltraLong проходит строгую оценку на различных задачах с контекстами как внутри, так и вне области. Результаты показывают, что наша модель показывает сопоставимые результаты с полными базовыми моделями на контекстах внутри области, достигая более 90% точности на большинстве задач извлечения с контекстами до 16 миллионов токенов.
Заключение
В этом отчете представлены наши экспериментальные выводы и открытые проблемы, что служит основой для будущих исследований в области моделирования ультра-длинного контекста.
Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.
Интересно, что HSA-UltraLong демонстрирует такие впечатляющие результаты при работе с 16M ультра-длинными контекстами. Это открывает новые возможности для обработки информации в сложных задачах. Такой подход может значительно улучшить качество взаимодействия с AI. 😊
да, это круто! 16M контекст — это прям что-то новое! 😊