Основной контент книги Локальные нейросети на MacBook: зачем, как выбрать, MLX, квантование, Dense vs MoE | Кир Белевич
Подкаст

Длительность выпуска 1 ч. 30 мин.

2026 год

16+

Локальные нейросети на MacBook: зачем, как выбрать, MLX, квантование, Dense vs MoE | Кир Белевич

О подкасте

Обсуждаем локальные большие языковые модели (LLM) с Киром Белевичем — техническим руководителем, ex-Яндекс и автором SVGO.


Разбираемся, зачем запускать нейросети на своём MacBook, когда есть подписка на ChatGPT и Claude за $20. Как ИИ меняет разработку, почему vibe-coding ведет к деградации инженеров, как выбрать идеальную модель на Hugging Face и что такое квантование, MLX, GGUF и RAG.


Если вы хотите понять, как работают локальные LLM, убьет ли ИИ джунов и стоит ли покупать Mac Studio ради домашнего инференса — этот выпуск для вас!


Больше интересного в телеграм-канале DevSpotting.


Тайм-коды

00:37 - Вступление

02:40 - Кто такой Кир Белевич?

03:21 - Как MacBook (M2 Max) справляется с LLM: шум, нагрев и сценарии использования

06:36 - Почему локальные модели, а не облачные гиганты (Anthropic/OpenAI)?

10:21 - Self-host философия: зачем нужна независимость от корпораций

11:32 - Главный минус Vibe-coding: ИИ не должен заменять мозг разработчика

14:10 - Сравнение качества открытых моделей с проприетарными

16:31 - Как ИИ помогает продакт-менеджерам в быстром прототипировании

20:17 - Деградация индустрии: почему зумеры становятся новыми скрипт-кидди

21:57 - Локальная база знаний (RAG), векторные БД и DeepSeek для ресёрча

25:23 - Практика: как выбрать модель на Hugging Face?

28:43 - Что такое квантование моделей и как оно влияет на «ум» нейросети

36:36 - Как измеряют деградацию ИИ: Perplexity и KLD

41:13 - MLX, GGUF и победа динамического квантования Unsloth

42:16 - Почему бенчмарки (SWE-bench) больше не работают

49:26 - Движки инференса: Llama.cpp как Linux в мире ИИ

51:54 - Speculative Decoding и битва за размер контекста

01:00:39 - Архитектуры моделей: Dense vs MoE (Mixture of Experts)

01:14:12 - Можно ли файн-тюнить на маке?

01:19:26 - Снятие цензуры

01:21:32 - Будущее разработчиков: почему на вакансию CTO присылают 1000 ИИ-откликов

01:28:40 - ИИ никуда не уйдет: ищите свое место под солнцем


Затронутые технологии и темы:

Hugging Face https://huggingface.co/ — как гитхаб, только для нейросетейMLX: фреймворк машинного обучения от Apple (Metal API)Llama.cpp & LM Studio: инструменты для локального запуска LLMUnsloth & AWQ: форматы и инструменты для квантования моделейСравнение KLD и PPL для разных моделей https://github.com/deepsweet/mlx-eval/tree/main/results (инструменты для сравнения: https://github.com/deepsweet/mlx-eval)Рекомендуемая Киром модель для макбука на 48Гб памяти: https://huggingface.co/deepsweet/Qwen3.6-35B-A3B-MLX-oQ4


Кир в интернете

https://kir.belevi.ch/https://t.me/deepsweethttps://github.com/deepsweethttps://huggingface.co/deepsweet


Не забудьте подписаться на Telegram-канал: https://t.me/devspotting

Ставьте лайк и подписывайтесь на канал!

Последнее обновление:
24 августа 2026
Что такое подкаст?
Войдите, чтобы оценить книгу и оставить отзыв
Возрастное ограничение:
16+
Дата выхода на Литрес:
24 августа 2026
Дата написания:
30 апреля 2026
Длительность:
1 ч. 30 мин. 55 сек.
Издатель:
Владимир Гриненко
Правообладатель:
Автор
Формат скачивания:
1x