Ditado por voz no Mac
Em resumo: o Parakeety é um software de ditado push-to-talk local para Mac. Mantenha uma tecla premida, fale, solte, e o seu texto aparece no cursor, em qualquer aplicação. O reconhecimento de voz é executado inteiramente no seu Mac através do Apple Neural Engine, nada é enviado para um servidor. Deteta automaticamente 25 idiomas europeus, português incluído. Sem conta e sem subscrição: $25 um pagamento único, com um teste gratuito de 7 dias. Mais detalhes na página inicial: ditado local para Mac que cola no cursor.
Como funciona
Mantenha a tecla § premida, fale, e depois solte. O texto é colado na posição atual do cursor, através de uma combinação Cmd+V sintetizada na aplicação que tem o foco. Funciona em qualquer sítio onde um campo de texto aceite colar: Mail, Notas, Slack, Word, os campos do navegador, o Terminal. Não há extensões para instalar, porque a integração acontece ao nível do sistema operativo e não dentro de cada aplicação.
O panorama num relance
Cada ferramenta de ditado para Mac situa-se algures numa linha que vai do totalmente na nuvem ao totalmente no dispositivo. Aqui fica onde caem as principais opções e para que serve realmente cada uma.
| Ferramenta | Onde é executado | Modelo de preço | Ideal para |
|---|---|---|---|
| Parakeety | Sempre no dispositivo | $25 pagamento único | Ditado push-to-talk que cola no cursor em qualquer aplicação |
| Apple Dictation | No dispositivo nos Macs recentes, com exceções | Grátis, integrado no macOS | Ditado curto e informal nos idiomas mais comuns |
| MacWhisper | Transcrição local; as funções de IA usam a nuvem | Versão gratuita e Pro paga | Transcrição de ficheiros de áudio e vídeo pré-gravados |
| SuperWhisper | Híbrido: modelos locais e na nuvem | Subscrição ou pagamento único | Um menu de vários motores com pós-processamento de IA |
| Wispr Flow | Nuvem | Subscrição | Ditado na nuvem com limpeza de IA, multiplataforma |
| Dragon | Nuvem (Dragon Medical One); sem aplicação para Mac atualmente | Subscrição | Ditado médico empresarial no Windows |
Porquê local
Os argumentos a favor da transcrição no dispositivo são três coisas ao mesmo tempo: privacidade, velocidade e durabilidade. Quando o modelo é executado no seu Mac, o áudio é capturado em memória, transcrito, colado no cursor e descartado. Nada é escrito no disco e nada é carregado. Não há um repositório de dados para intimar, nenhuma superfície de fuga e nenhuma dúvida sobre o que um fornecedor regista.
A ressalva honesta é que «local» é um espetro, não uma caixa a assinalar. Várias aplicações populares transcrevem localmente mas fazem passar a transcrição por um grande modelo de linguagem na nuvem para a limpar, o que devolve as suas palavras à rede. Por isso a pergunta raramente é «é local?», mas «que parte é local?». No Parakeety, a resposta é: tudo o que diz respeito ao seu áudio.
A velocidade é o que mais se sente. Um serviço na nuvem acrescenta uma ida e volta pela rede a cada frase; um modelo local no Apple Neural Engine não. E a durabilidade conta numa ferramenta em que se apoia todos os dias: um serviço por subscrição pode mudar os preços, o modelo ou as condições debaixo dos seus pés, ou encerrar. Uma aplicação que corre na sua própria máquina continua a funcionar.
Tudo fica no seu Mac
O áudio é capturado num buffer em memória, processado no Apple Neural Engine, o texto é colado e o buffer é descartado de imediato. Não há qualquer transmissão para a OpenAI, a Anthropic ou outro servidor, simplesmente porque não existe transmissão. As únicas ligações de saída são a transferência única do modelo no primeiro arranque e verificações periódicas da licença, que enviam apenas a chave de licença, um hash de um identificador de hardware e o nome da máquina. Sem áudio, sem transcrições, sem análise, sem telemetria.
O modelo por baixo
A precisão é uma propriedade do modelo de voz, não do lugar onde é executado. O modelo que mudou o que é possível num Mac é o NVIDIA Parakeet TDT 0.6B v3: cerca de 600 milhões de parâmetros, uma arquitetura de transdutor e, neste momento, o primeiro lugar da Hugging Face Open ASR Leaderboard.
Em resumo, porque é que isto importa: o Parakeet TDT v3 apresenta uma taxa de erro por palavra de 6,32% face aos 7,44% do Whisper Large V3, é executado cerca de uma ordem de grandeza mais depressa no mesmo hardware e usa um design de transdutor que produz silêncio durante os silêncios em vez de alucinar texto, como podem fazer os sistemas baseados em Whisper. O compromisso é a cobertura de idiomas: 25 línguas europeias face à centena do Whisper. Para ditar nesses idiomas em Apple Silicon, é o modelo a preferir.
25 idiomas, detetados automaticamente
O modelo subjacente (NVIDIA Parakeet) deteta automaticamente qual dos 25 idiomas europeus está a falar, sem qualquer seleção manual. Pode passar do português para o inglês a meio de uma frase sem tocar em nenhuma definição. Prático se trabalha em dois idiomas ou se intercala termos técnicos e nomes próprios vindos de outra língua. Os idiomas de fora da Europa, como o mandarim, o japonês ou o árabe, não são cobertos pelo modelo; isso também faz parte do retrato honesto.
Trabalho regulado e privacidade
No ditado clínico e jurídico, a questão da privacidade torna-se uma questão de conformidade, e há duas respostas válidas. Uma é o ditado na nuvem ao abrigo de um contrato de subcontratação do tratamento de dados; a outra é o ditado no dispositivo, em que o áudio nunca chega a sair do Mac. Como no Parakeety nada é carregado, não existe qualquer repositório de dados em poder de um fornecedor que seja preciso proteger ou divulgar.
É uma afirmação sobre a arquitetura, não uma promessa de conformidade. Saber se a arquitetura no dispositivo basta para o seu consultório ou escritório depende das suas próprias obrigações regulamentares, por exemplo o RGPD na Europa ou a HIPAA nos Estados Unidos, e cabe-lhe a si verificá-las. O Parakeety reduz a superfície de exposição ao manter o áudio local; não assina contratos em seu nome.
Sobre este guia
Eu faço o Parakeety, uma aplicação para Mac de uma só pessoa. Construí-a porque as opções de ditado existentes pediam todas demasiado: uma subscrição, uma conta, ou a minha voz no servidor de outra pessoa. O Parakeety é a versão que eu queria para mim: uma compra única e tudo fica no dispositivo. Sendo uma atividade de uma só pessoa, sou também o responsável pelo tratamento dos dados, e como nunca é transmitido áudio, essa lista é curta.
FAQ
- O Parakeety funciona offline?
- Sim. O reconhecimento de voz é executado inteiramente no seu Mac, no Apple Neural Engine. O áudio nunca sai do dispositivo e não há nenhuma ligação de rede no momento da transcrição. As únicas ligações de saída são a transferência única do modelo de voz no primeiro arranque e as verificações periódicas da licença.
- O Parakeety é tão preciso como a nuvem?
- Num Mac com Apple Silicon recente, sim, e muitas vezes mais. O modelo que o Parakeety usa, o Parakeet TDT 0.6B v3, apresenta uma taxa de erro por palavra de 6,32% face aos 7,44% do Whisper Large V3 na Hugging Face Open ASR Leaderboard. A precisão é uma propriedade do modelo, não do lugar onde é executado. Um bom modelo local no Apple Neural Engine iguala ou supera a maioria dos serviços de ditado na nuvem, sem a latência de uma ida e volta pela rede.
- Que idiomas são suportados?
- O Parakeety deteta automaticamente 25 idiomas europeus, entre eles português, inglês, alemão, francês, espanhol, italiano, neerlandês e polaco. Não precisa de configurar nada, é o modelo que reconhece sozinho o idioma que está a falar. Mandarim, japonês, coreano, árabe, hindi e turco não são suportados de momento.
- Quanto custa o Parakeety?
- $25 um pagamento único, com atualizações vitalícias. Sem subscrição e sem conta. Antes disso, há um teste gratuito de 7 dias, sem cartão.
- Que Macs são suportados?
- Os Macs com Apple Silicon (arm64) e macOS 14 ou posterior. Os Macs com Intel não são suportados.
Experimente
O Parakeety é uma aplicação da barra de menus do Mac. Mantenha a tecla § premida, fale, solte, e as suas palavras são coladas no cursor, na aplicação em que estava a escrever. O áudio nunca sai da máquina. Há um teste gratuito de 7 dias, sem cartão. Depois, são $25 um pagamento único.