Я устал печатать. Не в том смысле, что клавиатура плохая или пальцы болят. Просто в какой-то момент заметил: большую часть времени за компьютером я трачу на то, чтобы перекладывать мысли из головы в текст. Пишу статью, пишу промпт для агента, пишу ответ в чат, пишу комментарий к PR. Слова уже сформировались, а пальцы всё ещё догоняют.

А потом подумал: я же разговариваю быстрее, чем печатаю. Все разговаривают быстрее. Почему я до сих пор ввожу текст пальцами, если у меня есть микрофон и компьютер, который понимает речь?

Спойлер: теперь я диктую. Нажимаю горячую клавишу, говорю, и текст появляется там, где стоит курсор. В любом приложении. Бесплатно, офлайн, без единого сетевого запроса. Рассказываю, как это устроено и почему я перестал возвращаться к клавиатуре.

Нажал, сказал, отпустил

Spokenly работает так: зажимаешь шорткат, говоришь, отпускаешь. Текст падает прямо в курсор. Не в отдельное окно, не в буфер обмена, не в предпросмотр с кнопкой «вставить». Сразу туда, где ты сейчас пишешь.

Это значит, что диктовать можно куда угодно. В браузер, в почтовый клиент, в IDE, в чат, в Notion, в Google Docs, в адресную строку. Приложение не знает, что ты диктуешь, и ему всё равно. Spokenly просто печатает за тебя, как если бы кто-то очень быстро набирал текст на клавиатуре.

На Mac, Windows и Linux нажимаешь шорткат, говоришь, отпускаешь. На iPhone диктуешь через системную клавиатуру Spokenly. Четыре платформы, одна механика.

Важно: Spokenly работает системно, а не внутри одного приложения. Это не плагин для Word и не расширение для браузера. Он перехватывает голос на уровне операционки и превращает его в нажатия клавиш.

Бесплатно, офлайн, без аккаунта

Вот что меня зацепило сначала. Локальные модели Whisper и Parakeet полностью бесплатны. Без лимитов, без триала, без водяных знаков. Скачиваешь приложение, ставишь модель, диктуешь. Аккаунт не нужен.

Whisper — это модель распознавания речи от OpenAI, которая работает локально на твоём устройстве. Parakeet — модель от NVIDIA, тоже локальная, заточенная под скорость. Обе скачиваются один раз и потом работают без интернета.

Локальный режим можно заблокировать жёстче: включить Local-only, и приложение перестаёт делать любые сетевые запросы. Ноль запросов. Твой голос не покидает устройство. Не отправляется на сервер, не кэшируется, не логируется. Для тех, кому приватность важна не на словах, это не маркетинговое обещание, а технический факт: сетевой стек отключён.

Я использую именно этот режим. Бесплатный, офлайн, локальный. Модель Whisper на моём Mac распознаёт русскую речь с точностью, которой у встроенной диктовки macOS нет. Технические термины, английские вставки в русском тексте, акценты — всё проходит без dance с настройками.

Сто языков и автоматическое определение

Spokenly поддерживает более 100 языков. Включая русский, английский, испанский, французский, немецкий, китайский, японский. Качество распознавания зависит от модели и языка, но Whisper и Parakeet справляются с техническим жаргоном и акцентами заметно лучше, чем встроенная диктовка Apple.

Но настоящая магия — автоматическое определение языка. Можно начать фразу на русском, продолжить на английском, и Spokenly не сломается. Он определит язык на лету и продолжит печатать. Для тех, кто mixes языки в одном предложении, это не удобная фича, а снятие барьера. Больше не нужно переключать язык перед диктовкой.

Голосовое программирование: разговаривай с агентами

Это та часть, ради которой я сел писать этот пост. Spokenly умеет не просто печатать текст, а печатать промпты для AI-агентов. Claude Code, Codex, Cursor — любые инструменты, которые принимают текстовый ввод. Нажал шорткат, сказал: «добавь обработку ошибок в функцию fetchUserData и сделай логирование через winston», отпустил. Промпт лёг в терминал агента.

На macOS в sideload-сборке есть MCP-сервер. MCP (Model Context Protocol) — открытый протокол, через который AI-агенты вызывают внешние инструменты. Spokenly отдаёт MCP-сервер, который агенты могут вызывать напрямую. Не «нажми шорткат и продиктуй», а программный интерфейс, который агент использует как инструмент трансляции голоса в текст.

Практический сценарий: я работаю с Claude Code, руки на клавиатуре, но мысль формулируется быстрее, чем я печатаю. Зажимаю шорткат, проговариваю задачу подробно, с контекстом, с оговорками, с уточнениями. Отпускаю. Claude Code получает развёрнутый промпт, который я бы печатал три минуты, за те семь секунд, пока я его сказал.

Инсайт: голосовой ввод для агентов — это не про скорость ради скорости. Это про плотность промпта. Говоря, я добавляю контекст, который при печати кажется «слишком длинным». Голос снимает психологический барьер: проще сказать пять уточняющих фраз, чем напечатать их.

AI Instructions: из сырой речи в чистый текст

Когда диктуешь, речь получается не идеальной. Запинки, повторы, слова-паразиты, отсутствие пунктуации. Spokenly решает это через AI Instructions — набор правил, которые применяются к тексту после распознавания.

AI Instructions исправляют грамматику, убирают filler words, форматируют текст под приложение, в которое ты диктуешь. Диктуешь в почту — получаешь структурированное письмо. Диктуешь в IDE — получаешь код-коммент с правильными отступами. Диктуешь в чат — получаешь короткое сообщение без воды.

Это не автозамена. Это полноценная обработка текста через языковую модель, которая понимает контекст приложения и применяет правила форматирования. Сырая речь на входе, чистый текст на выходе.

История, поиск и экспорт

Все диктовки сохраняются в историю. Можно искать по тексту, прослушать исходное аудио, экспортировать любую запись в один клик. Бесконечная история, доступная через поиск.

На практике это работает как лог голосовой активности. Сказал промпт, забыл, что именно сказал. Через неделю нашёл в истории, прослушал, скопировал. Для тех, кто диктует много, это не архив ради архива, а рабочий инструмент.

Тарифы: три варианта, один бесплатный

Spokenly доступен в трёх вариантах. Я использую первый — он бесплатный и покрывает всё, что мне нужно.

**План** **Цена** **Что входит**
Local Models $0 навсегда Whisper и Parakeet локально, безлимит, офлайн, без аккаунта
Your API Keys $0 навсегда Все локальные фичи + облачные модели через свои API-ключи (OpenAI, Deepgram, Groq). Real-time транскрипция. Spokenly ничего не берёт за транзит
Pro $8.33/мес ($99.99/год) Облачные модели с высокой точностью, синхронизация между устройствами, AI-очистка текста, готов из коробки. 14 дней на возврат

Разница между планами не в ограничениях бесплатного, а в дополнительной точности за деньги. Локальные модели бесплатны навсегда, без лимитов и без подписки. Pro добавляет облачные модели и синхронизацию. Your API Keys — промежуточный вариант: ты платишь только за API-вызовы своему провайдеру, Spokenly не берёт комиссию.

Для разработчиков, у которых уже есть API-ключи OpenAI или Deepgram, вариант «Your API Keys» означает: платишь за транскрипцию по тарифу провайдера, а приложение Spokenly бесплатно. Real-time транскрипция, без подписки.

Почему не встроенная диктовка macOS

У macOS есть своя диктовка. Она работает, но сравнение с Spokenly заканчивается быстро. Встроенная диктовка Apple использует собственную модель распознавания, которая хуже справляется с техническими терминами, акцентами и языками, отличными от английского. Real-time транскрипции нет — текст появляется с задержкой. AI-очистки текста нет — что сказал, то и получил, со всеми запинками.

Spokenly использует Whisper и Parakeet, модели, которые обучены на данных, где есть технический жаргон, разные акценты и неанглийские языки. Плюс streaming-движки, настроенные от ультра-быстрого до максимальной точности, с текстом, появляющимся в момент, когда ты замолкаешь. И AI-инструкции, которых у Apple нет.

Если встроенная диктовка перестала работать после обновления macOS, обычно причина в одном из четырёх: переключатель Dictation выключен в System Settings, языковая модель не докачалась, разрешение на микрофон отозвали после апдейта или конфликт шортката с другим приложением. Spokenly работает системно и не зависит от этого переключателя.

Вывод

Я перестал печатать большую часть текста. Не всю, большую часть. Короткие команды, быстрый код, точные правки — клавиатура. Всё, что длиннее двух предложений и не требует точной пунктуации на лету — голос.

Spokenly бесплатный, офлайн и работает везде. Локальные модели Whisper и Parakeet распознают речь точнее встроенной диктовки, 100+ языков с автоопределением, AI-инструкции чистят текст, MCP-сервер даёт агентам голосовой интерфейс. 100 000 активных пользователей и рейтинг 4.8 в App Store — не маркетинг, а людям реально удобно.

Если ты устал печатать — попробуй. Локальные модели бесплатны, аккаунт не нужен, ничего не отправляется в облако. Худшее, что случится, — вернёшься к клавиатуре.