ВЫБОР И ПРОИЗВОДИТЕЛЬНОСТЬ ЛОКАЛЬНЫХ БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЕЙ В ЗАДАЧАХ АВТОМАТИЧЕСКОЙ ИНТЕРПРЕТАЦИИ ПСИХОМЕТРИЧЕСКИХ ДАННЫХ
Главная статья
Аннотация
В работе систематизируются критерии выбора и производительностные характеристики локальных больших языковых моделей применительно к задаче автоматической интерпретации структурированных результатов психометрического тестирования. Задача требует одновременного выполнения нескольких ограничений: локальной обработки данных согласно требованиям российского законодательства о персональных данных, работы на типовом оборудовании рабочей станции, достаточного качества выходного текста. Рассмотрены классы открытых моделей семейства LLaMA, методы посттренировочной квантизации (GPTQ, AWQ, k-quants формата GGUF) и runtime-окружения локального инференса (llama.cpp, Transformers, vLLM). Приведены иллюстративные оценки производительности моделей размером 7–13 миллиардов параметров на CPU и потребительских GPU. Сформулированы рекомендации по выбору конфигурации в зависимости от доступного оборудования и требований к времени отклика.
Подробнее

Это произведение доступно по лицензии Creative Commons «Attribution-NonCommercial-ShareAlike» («Атрибуция — Некоммерческое использование — На тех же условиях») 4.0 Всемирная.
Неисключительные права на статью передаются журналу в полном соответствии с Лицензией Creative Commons By-NC-SA 4.0 (Международная)