Guias  /  Hermes Voice
Hermes Agent · Voice

Diga “Hey Hermes”. O agente acorda e trabalha.

O Hermes ganhou o elo que faltava para virar um assistente de voz de verdade: ele pode ouvir uma frase de ativação localmente, abrir uma sessão, entender seu pedido, responder em voz alta e voltar a esperar — sem você tocar no teclado.

Por Matheus Soier e Caio Imori · 12 min de leitura · Atualizado em 29/07/2026 · Nível: do zero ao avançado
Resposta rápida

Hermes Voice combina Wake Word, reconhecimento de fala, o agente completo e síntese de voz. A frase “Hey Hermes” é detectada no dispositivo e o recurso fica desligado até você ativá-lo. O áudio do pedido segue o provedor de transcrição que você escolheu — local ou cloud.

O que mudou na prática

Antes, o modo de voz começava com uma tecla ou um clique. Agora o Hermes pode ficar disponível em segundo plano e iniciar uma conversa quando escuta a frase configurada. É o padrão “Hey Siri”, só que ligado ao mesmo agente que usa terminal, arquivos, memória, navegador, skills e ferramentas.

01 · WakeEscuta local

O detector procura apenas a frase de ativação.

02 · CaptureLibera o microfone

O wake word pausa e o Hermes grava seu pedido.

03 · AgentExecuta de verdade

STT vira texto e aciona o pipeline completo do agente.

04 · ReplyResponde e rearma

O TTS fala a resposta e a escuta local retorna.

Hands-free

Começa e termina por voz

Diga “Hey Hermes” para começar. No desktop, uma frase inteira como “stop”, “goodbye” ou “cancel” encerra a conversa.

Full duplex

Você pode interromper

Fale enquanto o modelo pensa ou enquanto o áudio toca. O Hermes corta a resposta anterior e trata sua interrupção como o próximo turno.

Local first

O gatilho não vai para a nuvem

A escuta constante roda no dispositivo. Só depois da ativação o pedido entra no STT que você configurou.

Multi-profile

Cada perfil pode ter um nome

Com Sherpa, “Hey Coder” pode abrir o perfil de código e “Hey Trader” pode abrir outro contexto no desktop.

Privacidade: o que fica local e o que pode sair

A documentação da Nous Research é específica: o listener de wake word roda inteiramente no dispositivo e procura apenas a frase de ativação. Ele também vem desligado por padrão. Nada fica ouvindo até você usar /wake on ou clicar no ícone de orelha no app desktop.

Depois que o gatilho dispara, há uma diferença importante:

  • Wake word: local, com openWakeWord, Sherpa ou Porcupine.
  • Seu pedido: pode ser transcrito localmente com faster-whisper ou enviado a um STT cloud, conforme sua configuração.
  • Resposta: passa pelo modelo escolhido e pelo TTS configurado. Edge TTS não exige chave; outros provedores podem ser pagos.

Portanto, “wake word local” não significa automaticamente “conversa inteira local”. Para isso, escolha deliberadamente modelos, STT e TTS locais.

Instalação do zero

1. Faça o Hermes responder por texto primeiro

Não comece pelo microfone. Atualize ou instale o Hermes, configure um modelo e confirme que uma conversa normal funciona.

Terminal · instalar ou atualizar
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
hermes update
hermes
Windows PowerShell · instalação nativa
iex (irm https://hermes-agent.nousresearch.com/install.ps1)
hermes

Dentro do Hermes, pergunte algo simples: “Quais ferramentas você tem disponíveis?”. Só continue quando a resposta em texto estiver sólida.

2. Instale os extras de wake word e voz

Terminal · ambiente gerenciado do Hermes
cd ~/.hermes/hermes-agent
uv pip install -e ".[wake,voice]"

Instalações do desktop feitas com o pacote desktop já trazem essa pilha antecipadamente. No CLI, a instalação também pode acontecer sob demanda na primeira ativação.

3. Garanta as dependências de áudio

macOS
brew install portaudio ffmpeg
Ubuntu / Debian
sudo apt install portaudio19-dev ffmpeg

4. Configure STT e TTS

O wake flow se recusa a armar se não houver transcrição e voz de saída prontas. Rode:

hermes tools

Na seção de voz, escolha:

  • STT local: faster-whisper, sem chave de API.
  • STT cloud: Groq Whisper ou OpenAI, com a chave correspondente.
  • TTS sem chave: Edge TTS, padrão simples para começar.
  • TTS premium/local: ElevenLabs, OpenAI, NeuTTS e outros provedores suportados.

5. Ligue a escuta

Dentro de uma sessão Hermes
/wake on
/wake status
/wake off

O comando persiste a escolha no ~/.hermes/config.yaml. No desktop, clique no ícone de orelha ao lado do composer. Quando o status estiver ativo, diga “Hey Hermes”, espere a captura abrir e faça seu pedido.

Qual motor escolher

MotorCusto e chaveQuando usar
openWakeWordGrátis · sem chavePadrão recomendado. O modelo “Hey Hermes” já vem incluído e não exige treinamento.
SherpaGrátis · sem chaveQuando você quer digitar qualquer frase ou dar uma frase diferente para cada perfil.
PorcupineFree tier/pago · chave PicovoiceQuando você já usa o ecossistema Picovoice ou quer um arquivo de keyword próprio.

Para a maioria das pessoas, comece no openWakeWord. Troque para Sherpa quando a frase personalizada for parte do produto — por exemplo, perfis separados para código, pesquisa e operação.

Configuração que vale conhecer

~/.hermes/config.yaml
wake_word:
  enabled: true
  surface: auto
  input_device: null
  provider: openwakeword
  phrase: "hey hermes"
  sensitivity: 0.6
  confirmation_frames: 3
  start_new_session: true
  openwakeword:
    model: hey_hermes
    inference_framework: ""
  • surface: escolha cli, tui ou gui se várias superfícies estiverem abertas. Em auto, a primeira que armar fica dona do microfone.
  • sensitivity: o padrão atual é 0.6. Quanto maior, mais rígido e menor a chance de falso disparo.
  • confirmation_frames: exige três frames consecutivos acima do limiar no openWakeWord. Aumente para 4 ou 5 em ambientes barulhentos.
  • input_device: use o índice ou parte do nome do microfone quando o backend escolhe a entrada errada.
  • start_new_session: mantém cada ativação separada. Desative se você preferir continuar a sessão atual.

Frase personalizada sem treinar modelo

Com Sherpa, a frase é convertida em tokens no momento da configuração. O modelo inglês, de aproximadamente 13 MB, é baixado uma vez.

wake_word:
  enabled: true
  provider: sherpa
  phrase: "hey coder"

Frases com duas palavras, sons distintos e pelo menos duas sílabas funcionam melhor. Evite palavras comuns como “hello” ou “stop”, que aparecem em conversas normais.

Três usos que justificam o recurso

1. Debug sem tirar a mão do hardware

Diga: “Hey Hermes, leia os últimos erros do meu projeto e me explique a causa.” Continue perguntando, interrompa quando a direção estiver errada e peça a correção. O valor não é a voz bonita; é manter o mesmo agente com acesso ao contexto e às ferramentas.

2. Captura de ideias em movimento

Use o Hermes para transformar pensamentos soltos em briefing, plano, lista de riscos e próxima ação. A conversa contínua permite corrigir a estrutura sem voltar ao teclado.

3. Perfis ativados por frases diferentes

No desktop, habilite Sherpa nos perfis e use frases como “Hey Coder” e “Hey Research”. Uma única escuta pode identificar qual perfil foi chamado, trocar o contexto e abrir uma sessão nova.

Quando ele “está ouvindo”, mas não acorda

Mac com Apple Silicon

Deixe inference_framework vazio. O Hermes seleciona TFLite automaticamente porque o backend ONNX do openWakeWord pode produzir scores quase zerados no macOS ARM64. Se você fixar ONNX, a interface pode mostrar “listening” e nunca disparar.

Há outra armadilha: o desktop e o backend Python recebem permissões de microfone separadas. Abra Ajustes do Sistema → Privacidade e Segurança → Microfone, autorize o terminal, Python ou Hermes que aparece na lista e religue o wake word.

Windows escolheu um microfone silencioso

Push-to-talk e wake word usam caminhos diferentes. Descubra o dispositivo no /wake status e fixe a entrada:

hermes config set wake_word.input_device "Microphone Array"

Dispara com conversa de fundo

Suba sensitivity para algo próximo de 0.7 ou 0.8. Se estiver no openWakeWord, aumente confirmation_frames para 4 ou 5. Mude uma variável por vez e teste no ambiente real.

O microfone abre e nada acontece

Execute /wake status. O Hermes informa se falta STT, TTS, dependência, modelo ou dispositivo. O recurso agora recusa a ativação quando a conversa de ponta a ponta não está pronta, evitando um “ouvido” que escuta e não responde.

Checklist de saída

  • Hermes responde normalmente por texto.
  • Os extras [wake,voice] estão instalados.
  • STT e TTS foram escolhidos em hermes tools.
  • /wake status mostra o listener ativo e o microfone correto.
  • “Hey Hermes” abre uma sessão e captura um pedido real.
  • Dizer “stop” sozinho encerra a conversa, sem virar um prompt.
  • O limiar foi testado no ambiente em que você realmente trabalha.

Fontes oficiais

Documentação e código conferidos em 29/07/2026. Comandos, provedores e padrões podem mudar em atualizações futuras.

Ative primeiro o padrão oficial.

Comece com “Hey Hermes”, confirme o fluxo completo e só depois personalize frase, perfis e sensibilidade.

SYS.SCHOOL · formação contínua

O guia resolve uma tarefa. A School ensina você a dominar o sistema inteiro.

São 80 aulas e 20 horas de conteúdo atualizado, organizadas para levar você do primeiro prompt aos agentes, automações e projetos publicados. Aprenda no seu ritmo com Matheus Soier e Caio Imori — e continue recebendo as novas versões das ferramentas.

80aulas práticas
20hde conteúdo
sempreatualizado
Conhecer a SNPS School

Do primeiro prompt ao projeto no ar · acesso às atualizações