Vicuna fine-tuning ShareGPT диалоги instruction tuning LLaMAVicuna — open-source LLM, разработанный LMSYS Org, исследовательской группой из UC Berkeley, Carnegie Mellon University, Stanford University, UC San Diego и Mohamed bin Zayed University of Artificial Intelligence. Модель создана путём дообучения LLaMA-13B на ~70 000 диалогов из ShareGPT.com. Предварительные оценки с GPT-4 в роли судьи показали более 90% качества ChatGPT в задачах reasoning, кодирования и ролевых сценариях. Отличительная черта Vicuna — экономичность обучения: модель 13B обучена менее чем за $300 на восьми A100 за один день. Версия 7B обошлась примерно в $140.
Версии Vicuna
Vicuna базируется на LLaMA и Llama-2 и обучена на диалогах с ShareGPT. Доступна в вариантах Vicuna-7B и Vicuna-13B, оба рассчитаны на многоходовые разговоры. Vicuna v1.5 основана на Llama 2 и поддерживает контекстные окна 4K и 16K токенов. Vicuna-33B (июнь 2023) достигла 7.88 на MT-Bench, приблизившись к проприетарным моделям при более высоких вычислительных требованиях.
Версия
Параметры
Контекст
База
Vicuna v1.1
7B / 13B
2K
LLaMA 1
Vicuna v1.3
7B / 13B
2K
LLaMA 1
Vicuna v1.5
7B / 13B
4K / 16K
Llama 2
Vicuna-33B
33B
2K
LLaMA 1
Возможности Vicuna
Многоходовые диалоги и инструкции
Vicuna демонстрирует сильные возможности следования инструкциям: ведёт естественные многоходовые диалоги, сохраняя контекст и адаптируясь к ходу разговора — достигается дообучением на ~70 000 диалогов ShareGPT.
Широкий спектр задач
Модель хорошо справляется с суммаризацией, творческим письмом, ролевыми играми, помощью в кодировании и решением задач — делая упор на полезность, релевантность и детализацию ответов.
Оценка MT-Bench
Для оценки качества используется MT-Bench — набор многоходовых открытых вопросов. Сильные LLM, в том числе GPT-4, выступают судьями и оценивают качество ответов моделей.
Ограничения
Vicuna имеет ограничения в задачах, требующих сложного reasoning и математических вычислений, и может периодически генерировать неточную информацию.
FastChat — платформа деплоя
FastChat предоставляет распределённую мультимодельную систему обслуживания с веб-интерфейсом и OpenAI-совместимыми RESTful API. Платформа включает код обучения и оценки для актуальных моделей, в том числе Vicuna и MT-Bench. Vicuna доступна через:
CLI — запуск через FastChat командной строкой
OpenAI-compatible API — замена OpenAI API без смены кода
HuggingFace — загрузка весов и инференс
Ollama / LM Studio — локальный запуск на потребительском железе
Требования к железу
Для запуска требуется около 14 ГБ видеопамяти для Vicuna-7B и 28 ГБ для Vicuna-13B. Vicuna-13B с 8-битным сжатием работает на одной GPU с 16 ГБ VRAM — RTX 3090, RTX 4080, T4, V100 (16GB) или AMD RX 6800 XT. Vicuna-7B запускается на MacBook M1 32GB со скоростью 1–2 слова в секунду.
Модель
VRAM (fp16)
VRAM (8-bit)
VRAM (4-bit)
Vicuna-7B
~14 ГБ
~8 ГБ
~4–5 ГБ
Vicuna-13B
~28 ГБ
~16 ГБ
~6–8 ГБ
Vicuna-33B
~65 ГБ
~35 ГБ
~18 ГБ
Лицензия и открытость
Кодовая база FastChat выпущена под Apache License 2.0, допускающей коммерческое использование, модификацию и распространение при указании авторства. Веса Vicuna наследуют лицензионные ограничения базовых моделей LLaMA/Llama 2. В июле 2023 года Vicuna была загружена более двух миллионов раз на HuggingFace, что отразило стремительное принятие разработчиками и исследователями.
Кому подходит Vicuna
Аудитория
Сценарий
ML-исследователи
Эксперименты с open-source LLM, бенчмаркинг, fine-tuning
*Зависит от версии базовой модели (LLaMA 1 — некоммерческая, Llama 2 — условно коммерческая) Vicuna — лучший выбор для исследований и прототипирования многоходовых диалогов. Mistral 7B опережает по производительности при меньшем размере. LLaMA 2 — более гибкая лицензия для коммерции. Alpaca — устаревший аналог, существенно уступающий Vicuna.
Часто задаваемые вопросы
Что такое Vicuna? Vicuna — open-source LLM, разработанный LMSYS Org при участии исследователей из UC Berkeley, Carnegie Mellon University, Stanford и UC San Diego. Создана путём fine-tuning LLaMA на диалогах ShareGPT.
Vicuna бесплатна? Да. Веса модели и код FastChat полностью бесплатны. Расходы возникают только при облачном деплое или обучении.
Чем Vicuna отличается от LLaMA? После дообучения на 70K диалогов ChatGPT Vicuna генерирует более детальные и структурированные ответы по сравнению с базовой LLaMA и Alpaca, сопоставимые по качеству с ChatGPT.
Можно ли запустить Vicuna локально? Да. Локальный запуск обеспечивает работу без интернета и возможность настройки модели — fine-tuning на proprietary-данных или оптимизацию параметров под конкретные задачи.
Какой контекст поддерживает Vicuna? Vicuna v1.5 основана на Llama 2 и поддерживает контекстные окна 4K и 16K токенов.
Vicuna подходит для коммерческого использования? Кодовая база FastChat выпущена под Apache License 2.0. Веса Vicuna наследуют ограничения базовых моделей — LLaMA 1 не предназначен для коммерческого использования, Llama 2 допускает его условно.
Итог
Vicuna — пионер открытого LLM-пространства, доказавший, что качество уровня ChatGPT достижимо с бюджетом в $300 и открытыми данными. Vicuna вдохновила последующие проекты — WizardLM и другие — и сыграла ключевую роль в демократизации доступа к продвинутым языковым моделям, сместив фокус с проприетарных систем на воспроизводимые open-source альтернативы. Для современного продакшна лучше рассмотреть Llama 3, Mistral или Qwen. Для обучения, исследований и понимания архитектуры instruction-tuned LLM — Vicuna остаётся ценным историческим и практическим ресурсом.