Исследователи из России нашли способ проверить, как ИИ понимает длинные тексты
Российские исследователи разработали первый инструмент, позволяющий комплексно оценивать работу крупных языковых моделей с длинными текстами на русском языке.
Разработка представлена на конференции EMNLP 2025 в китайском Сучжоу, сообщает Центр научной коммуникации МФТИ.
Новый тест решает проблему отсутствия единого метода для проверки того, как искусственный интеллект обрабатывает большие текстовые массивы. До сих пор разработчики использовали собственные подходы, что мешало сопоставлять результаты.
Инструмент создан при участии специалистов SberAI, НИУ ВШЭ, Института искусственного интеллекта AIRI и МФТИ. Он включает 18 заданий разных типов и уровней сложности, позволяющих проверить способность моделей работать с текстами объемом от 4 до 128 тысяч структурных элементов. В заданиях ИИ должен находить нужные фразы, отвечать на вопросы по содержанию и сопоставлять разрозненные факты.
Авторы протестировали 17 популярных языковых моделей и пришли к выводу, что качество их работы снижается по мере увеличения длины текста. Лучший результат показала модель GPT-4o, среди систем с открытыми параметрами для российских исследователей — GLM4-9B-Chat. Разработчики рассчитывают, что новый тест ускорит создание ИИ, способных эффективно понимать длинные тексты на русском языке.