/EVSTYGNEYМаркетинг на языке денег
ИИ и инструменты

Нейросеть на столе за 100 тысяч: проверил четыре локальные модели на Mac mini с 16 ГБ

TL;DR Mac mini M6 с 16 ГБ памяти за 99 990 ₽ тянет модели на 26–35 миллиардов параметров и пишет 45–59 токенов в секунду — 20–30 слов, быстрее, чем вы читаете. Я прогнал на нём четыре бесплатные модели через 33 задачи. Две из них, Gemma 4 от Google и Qwen 3.6 от Alibaba, справились с рутиной почти как облачная нейросеть: верно назвали причину потери сделки в 10 учебных звонках из 12, разобрали 40-минутную встречу за 40 секунд, не поставили в протокол ни одного срока, которого не было в разговоре, написали рабочий код. Две другие, GigaChat 3.1 от Сбера и gpt-oss-20b от OpenAI, в том же протоколе поверили сбою распознавания речи, а GigaChat вдобавок сдвинула один дедлайн на год назад. Облачную нейросеть Мак не заменяет: заголовки и тексты у локальных моделей плоские. Он забирает массовую однотипную работу и данные, которые не хочется отдавать на чужой сервер. Ниже стенд, результаты по каждой задаче, где модели ошибаются, и калькулятор, за сколько Мак разберёт ваши звонки. Чтение — минут двенадцать.

Я Егор, десять лет в перформанс-маркетинге. Мак я покупал под одну задачу: озвучивать ролики своим клонированным голосом без платного сервиса. Озвучка работает, минута звука готова за 40 секунд. Дальше стало интересно, что ещё можно поручить коробке размером с толстую книгу. У любого отдела маркетинга и продаж есть работа, которую жалко отдавать живому человеку и страшно отдавать облачному сервису: прослушка звонков, протоколы встреч, сверка текстов с источниками. Я проверил, справится ли с ней машина ценой в месячную зарплату джуна.

В деньгах Подписка на облачную нейросеть стоит около двух тысяч рублей в месяц. Если купить Мак вместо неё, он окупится года через четыре, и ради этого покупать его бессмысленно. Мак окупается там, где задач тысячи: сотни звонков в неделю, ежедневная разметка новостей или заявок, протоколы всех встреч. И там, где данные нельзя выносить наружу.

Что за стенд

Mac mini M6, 16 ГБ общей памяти, 256 ГБ диска, 99 990 ₽ в московском магазине в сентябре 2026 года. Модели запускал бесплатной программой llama.cpp: она поднимает на Маке сервис, к которому любой скрипт обращается так же, как к облачной нейросети.

Простыми словами Размер модели измеряют в миллиардах параметров. Чем больше, тем она умнее и тем больше памяти ест. Модель на 35 миллиардов в обычном виде весит 70 ГБ и в 16 ГБ не влезает. Помогают два приёма. Первый — сжатие: каждый параметр хранят в 2–3 битах вместо 16, модель худеет до 11 ГБ и немного глупеет. Второй — «смесь экспертов»: модель состоит из множества узких специалистов, и на каждое слово работают только 3 миллиарда параметров из 35. Поэтому она и влезает, и отвечает быстро.

Проверял четыре модели. Все бесплатные, лицензии разрешают коммерческое использование:

Модель Разработчик Параметров всего / работает на слово Файл Лицензия
Qwen 3.6 35B-A3B Alibaba 35 млрд / 3 млрд 11,5 ГБ Apache 2.0
Gemma 4 26B-A4B Google 25 млрд / 3,8 млрд 11,4 ГБ Apache 2.0
gpt-oss-20b OpenAI 21 млрд / 3,6 млрд 11,6 ГБ Apache 2.0
GigaChat 3.1 Lightning Сбер 10 млрд / 1,8 млрд 6,5 ГБ MIT

По умолчанию macOS отдаёт видеокарте только часть общей памяти, и модель на 11,5 ГБ не запускается. Лимит поднимается одной командой в терминале, sudo sysctl iogpu.wired_limit_mb=12800, и слетает после перезагрузки.

Как проверял

Три набора задач. У каждой есть правильный ответ, с которым можно сравнить.

  1. 15 коротких задач на свежих новостях из открытых лент. Взял автомобильные: в них много конкретики, которую легко проверить, — марки, модели, цены, даты. Задания: отнести новость к одной из 11 рубрик, разложить её по полям в формате JSON (марка, модель, цена, тип события), написать заголовок до 60 знаков. Эталон — ответы облачной нейросети Claude.
  2. 12 учебных звонков в отдел продаж. Диалоги я написал сам по заданному сценарию: мебель, окна, автосалон, стоматология, фитнес. У каждого заранее известен ответ: на каком этапе оборвался разговор, почему не случилась продажа, что пообещал менеджер. Звонки озвучены синтетическим голосом macOS и распознаны бесплатной моделью GigaAM.
  3. Шесть задач из обычной недели маркетолога. Разбор двух встреч по расшифровке записи с телефона, 20 и 40 минут. Проверка черновика статьи по источнику, в который я заранее спрятал пять ошибок. Редактура абзаца с канцеляритом. Функция на Python с семью автоматическими проверками. Запрос к базе данных на диалекте SQL.

Скорость: быстрее, чем вы читаете

Модель Пишет, токенов в секунду Читает, токенов в секунду Разбор 40-минутной встречи
GigaChat 3.1 94 1 736 83 с
Qwen 3.6 59 1 163 37 с
gpt-oss-20b 54 1 082 37 с
Gemma 4 47 1 117 40 с

Замеры llama-bench на Mac mini M6 16 ГБ, 30 сентября 2026. Токен — примерно полслова русского текста. Встреча — около 9,5 тысячи токенов расшифровки.

Перед покупкой я собирал чужие замеры и ждал для Qwen от 5 до 38 токенов в секунду, в зависимости от источника. Вышло 59. Человек читает три-четыре слова в секунду, так что ждать модель не приходится.

Самая быстрая — GigaChat, она почти вдвое легче остальных. Зато на длинной встрече её скорость упала до 15 токенов в секунду, и разбор занял 83 секунды против 37 у Qwen.

Короткие задачи: рубрики, поля, заголовки

Задача Qwen 3.6 Gemma 4 gpt-oss-20b GigaChat 3.1
Рубрика из 11 совпала с эталоном 4 из 5 4 из 5 3 из 5 3 из 5
Поля совпали с эталоном 4 из 5 3 из 5 2 из 5 4 из 5
Заголовок уложился в 60 знаков 5 из 5 4 из 5 4 из 5 2 из 5

Ответ модели ограничен схемой: рубрику можно выбрать только из списка, поля заполнить только по шаблону.

Одну новость все четыре отнесли не туда, куда эталон: линейку грузовиков «Урал» Qwen записала в «АвтоВАЗ и Lada», Gemma — в «Запчасти и сервис». Лечится двумя-тремя примерами в запросе.

Интереснее заголовки. Qwen и Gemma пишут корректно и скучно: «Volkswagen Jetta M6: старт продаж в Китае». Облачная нейросеть на ту же новость дала «Jetta M6 — самый дешёвый электромобиль VW: приедет ли к нам». gpt-oss дописала от себя «первый доступный электромобиль Китая», GigaChat — «китайские авто дорожают». В новостях этого не было.

Звонки: где сделка потерялась

Замечание Все 12 звонков учебные. Я написал диалоги по заранее заданному сценарию: для каждого известны этап, исход и причина потери. Потом озвучил их синтетическим голосом macOS. Реальных клиентов, менеджеров и записей разговоров в тесте нет.

Главный вопрос разметки — почему не случилась продажа: не выяснили потребность, не назвали цену, не отработали возражение, клиент ушёл к конкуренту.

Поле Qwen 3.6 Gemma 4 gpt-oss-20b GigaChat 3.1
Причина потери 10 из 12 10 из 12 6 из 12 7 из 12
Исход звонка 9 10 9 9
Названная сумма 9 10 8 8
Конкурент 12 12 12 12
Цитата дословно из разговора 11 8 11 7
Секунд на звонок 2,9 4,0 6,5 2,6

Ответ ограничен схемой: причину потери и исход модель выбирает из заданного списка.

Цитата нужна, чтобы проверять модель: она обязана привести фразу из разговора, которая подтверждает её вывод. Скрипт ищет эту фразу в расшифровке. Если не находит, значит, модель пересказала своими словами или склеила две реплики, и такой звонок стоит переслушать человеку.

Лайфхак Не спрашивайте модель, насколько она уверена. Все четыре ставили себе от 0,8 до 1,0 и в правильных, и в ошибочных ответах, отличить одни от других по этой цифре нельзя. Проверка цитаты работает лучше.

Распознавание речи тоже локальное. GigaAM v3 ошиблась в 2,6% слов, если не считать разницу в записи чисел, и работала в 14 раз быстрее реального времени на процессоре Мака. Час разговоров распознаётся за четыре минуты.

Считается так: распознавание занимает часы разговоров, делённые на 14; разметка — 2,9 секунды на звонок; человек тратит на звонок его длительность плюс минуты на заполнение карточки. Включите JavaScript, чтобы подвигать ползунки.

Встречи: кто что обещал и к какому сроку

Две встречи, 20 и 40 минут, расшифровка с телефона с ошибками распознавания. Задание: суть, решения, задачи с исполнителями и сроками, открытые вопросы. Срок писать, только если он прямо прозвучал. Эталон — протокол каждой встречи, который я выверил по записи сам.

В расшифровке была ловушка. Участник сказал «четвёртый квартал», а распознавание записало «первый квартал». Дальше по разговору «четвёртый» звучит ещё дважды.

Qwen 3.6 Gemma 4 gpt-oss-20b GigaChat 3.1
Сроки все верные все верные рядом с верным «четвёртым кварталом» поставила и «первый» из сбоя распознавания «первый квартал» из сбоя и «конец 2025» — год, который в разговоре не звучал ни разу
Решения совпали с эталоном совпали с эталоном приписала встрече решение, которого на ней не было совпали с эталоном
Ключевые пункты 40-минутной встречи 7 из 8 7 из 8 5 из 8 4 из 8

Qwen и Gemma дали протокол, по которому можно работать: решения, задачи и сроки совпали с эталоном. Второстепенное потеряли обе: одну из инициатив и один промежуточный срок. Обе перепутали направление одного переноса, откуда и куда. Gemma вдобавок записала одно из названий латиницей на английский манер.

Замечание Выдуманный срок в протоколе хуже, чем пропущенный. Пропуск заметят на следующей встрече, а дедлайн «30 сентября», которого никто не называл, попадёт в чей-то календарь. Транскрибация на телефоне так и поступила с одной из этих встреч: её автоматический конспект поставил даты, которых в разговоре не было.

Проверка фактов, редактура и код

Проверка фактов Справка по Lada Granta, собранная из открытых источников, и черновик статьи с пятью ошибками: ТО каждые 10 000 км вместо 15 000, цепь ГРМ вместо ремня, 2016 год вместо 2018-го, расход в городе 7,5 л вместо 9,4 и фраза «самая продаваемая машина России уже десять лет», которой в источнике нет. Gemma и gpt-oss нашли все пять и ничего лишнего. Qwen нашла четыре и пропустила непроверенную фразу про продажи. GigaChat нашла все пять, но выписала заодно все верные утверждения, хотя задание было их не трогать.

Редактура Абзац «В целях повышения удобства пользователей нашего сервиса командой была осуществлена реализация функционала…» переписали все четыре. Чище всех Gemma: «Функция бесплатная и работает на основе данных более чем 400 тысяч объявлений». GigaChat сократила сильнее всех и по дороге потеряла «более чем».

Код Функция, которая обрезает заголовок до 60 знаков по целому слову и убирает висящий в конце предлог. Qwen и Gemma прошли все семь проверок. GigaChat — четыре: режет посреди слова. Код gpt-oss не запустился, в нём синтаксическая ошибка.

Запрос к базе Медиана просмотров статей по рубрикам за месяц. Ближе всех к рабочему запросу Gemma. Qwen использовала функцию, которой в этом диалекте SQL нет. На живой базе запросы не запускал.

Что влезает в 16 ГБ и что нет

Модель на 11,5 ГБ оставляет под текст около гигабайта. По моей прикидке, этого хватает примерно на 32 тысячи токенов за раз, то есть на 60–80 страниц: часовая встреча, статья с десятком источников, пачка из 200 новостей. Больше не влезет. Всю базу знаний или все статьи сайта придётся отдавать модели кусками, через поиск по базе.

Две большие модели одновременно не помещаются. Большая модель вместе с озвучкой тоже: даже в одиночку Qwen вытеснила на диск почти 4 ГБ. Работаем по очереди: сначала озвучка, потом разметка.

Чем плох такой тест

  • Звонки учебные. Синтетический голос распознаётся легче живого телефонного разговора с шумом и перебиваниями. Разметку это почти не искажает, распознавание на живых звонках будет хуже.
  • Выборка маленькая. 12 звонков и 15 коротких задач дают ориентир, и только. Разница в одну-две задачи между Qwen и Gemma лежит в пределах случайности.
  • Эталон коротких задач — тоже нейросеть. Ответы облачной модели я перепроверял руками, но спорные места остались: выставку шин можно назвать «обзором», а можно «другим».
  • Сжатые версии. Qwen работала примерно в 2,7 бита на параметр, Gemma — в 3. Полные версии умнее, но на 16 ГБ не запускаются, так что выводы относятся к сжатым сборкам, а не к моделям вообще.
  • Один компьютер и один язык. На Mac mini с 24 или 32 ГБ модели можно брать в более точном сжатии, и цифры будут другими. Все задачи на русском: gpt-oss, по словам самой OpenAI, обучена в основном на английском, и по-английски результат может быть другим.

Что осталось на диске

  • Gemma 4 — основная: протоколы встреч, проверка фактов, редактура, запросы к базе. Ровнее всех по качеству.
  • Qwen 3.6 — массовая разметка: звонки, рубрики, поля. На четверть быстрее Gemma и чаще цитирует дословно.
  • GigaChat 3.1 — пока лежит. Лёгкая, может работать рядом с озвучкой, но в протоколе встречи поставила год, которого не было.
  • gpt-oss-20b — удалил. В моих русскоязычных задачах она уступила в большинстве проверок, кроме сверки с источником.

Переключение между моделями занимает секунд десять, так что держать на диске две-три штуки удобно.

Краткие выводы

  • Mac mini M6 с 16 ГБ за 100 тысяч тянет модели на 26–35 миллиардов параметров со скоростью 45–59 токенов в секунду.
  • На рутине — разметке звонков, протоколах встреч, сверке с источником, простом коде — лучшие локальные модели близки к облачной нейросети.
  • Заголовки и тексты, которые должны цеплять, остаются за облачной нейросетью.
  • Бесплатная модель от крупной компании может поставить в протокол срок, которого не было. Любую модель стоит проверить на своих десяти задачах с известным ответом, прежде чем доверять ей тысячу.
  • Мак окупается объёмом: сотни звонков в неделю или данные, которые нельзя выносить. Под пару запросов в день хватит подписки.

Сколько часов в неделю ваши люди слушают звонки и пишут протоколы — и сколько из этой работы требует человека?

Откуда брали данные

  • Замеры скорости и качества — мои, Mac mini M6 16 ГБ, программа llama.cpp (сборка 11146), 29–30 сентября 2026 года. Все оценки относятся к конкретным сжатым сборкам и моим задачам, а не к моделям в целом.
  • Модели и лицензии: Qwen 3.6 35B-A3B (сборка Unsloth UD-IQ2_M), Gemma 4 26B-A4B (Unsloth UD-IQ3_XXS), gpt-oss-20b (Unsloth Q4_K_M), GigaChat 3.1 Lightning 10B-A1.8B (сборка Сбера Q4_K_M) — страницы моделей на Hugging Face. Фраза про обучение gpt-oss в основном на английском — из карточки модели OpenAI на Hugging Face.
  • Распознавание речи — GigaAM v3 от Сбера, лицензия MIT.
  • Эталон для коротких задач — Claude от Anthropic.
  • Цена Mac mini M6 16/256 — чек московского магазина, сентябрь 2026 года.