18.09.2026 Innovation House ІТ, стартапи, інновації

PrismML стиснула ШІ-модель Qwen у 10 разів: 5,9 ГБ і 98% якості

·390 слівредакція
PrismML стиснула ШІ-модель Qwen у 10 разів: 5,9 ГБ і 98% якості

Стартап PrismML представив Bonsai 2 27B — компактну версію відкритої моделі Qwen3.8 27B від Alibaba, яка займає лише 5,9 ГБ замість десятків гігабайтів. За даними розробників, новинка зберігає близько 98% продуктивності оригіналу.

Скорочення обсягу пам'яті, потрібної для роботи моделі, сягає приблизно 9–10 разів порівняно з вихідною Qwen3.8 27B. Завдяки цьому Bonsai 2 27B може працювати на звичайних комп'ютерах, а в перспективі — і на флагманських смартфонах.

Компанію заснували дослідники Каліфорнійського технологічного інституту. Очолює PrismML професор цього вишу Бабак Хассібі, фахівець із технологій стиснення даних. Серед радників — співзасновник Databricks Іон Стоїка, який також керує Sky Computing Lab при Каліфорнійському університеті в Берклі.

Ключова ідея технології — не лише менший розмір, а й мінімальні втрати якості. Перша версія Bonsai, що вийшла в березні, показувала близько 95% результатів оригінальної моделі в бенчмарках, тоді як Bonsai 2 досягла 98%. Оригінальну Bonsai завантажили понад 11 мільйонів разів, а ще компактніші моделі лінійки — додатково 2,6 мільйона разів.

Стиснення забезпечує зміна способу зберігання ваг моделі — параметрів, що містять знання, набуті під час навчання. Замість традиційного 16-бітного представлення PrismML використовує тернарні ваги, де кожен параметр набуває лише трьох значень: +1, -1 або 0. Це суттєво зменшує обсяг даних, потрібних для зберігання моделі.

Хассібі визнає, що певна втрата продуктивності під час стиснення неминуча, однак різниця близько 2% навряд чи буде помітною в більшості реальних сценаріїв використання.

Наступний крок компанії — стиснення значно більших моделей із сотнями мільярдів параметрів. Хассібі вважає, що саме великі моделі можуть виявитися навіть придатнішими до такого підходу, оскільки «з'являється більше можливостей для стиснення без втрати інтелектуального потенціалу».

«Інтелектуальні можливості будуть завжди під рукою, і це буде безплатно, адже модель працюватиме на пристрої, який ви вже придбали. До того ж це забезпечить конфіденційність, оскільки дані не потрібно буде надсилати в хмару», — пояснив Стоїка.

Вибір відкритої архітектури Qwen для таких оптимізацій відображає її статус однієї з провідних платформ у глобальній індустрії ШІ. Раніше відкриті моделі лінійки Qwen подолали позначку в 3 мільярди завантажень за пів року, суттєво випередивши американські аналоги від Google та Meta на майданчику Hugging Face.

Читайте також