🎙️ dsh-talk
September 2, 2026 · View on GitHub
🎙️ dsh-talk
- Canal 1024 store:
npm i -g dsh1024uma vez, depoisdsh1024 plugin --profile web add dsh-talk(conta para o ranking de instalações do deepseek1024.com).
Loop de sessão voice-first para o DeepSeek Harness: fale com ele e ouça a resposta.
Pressione o microfone, fale e a resposta é lida em voz alta — falar interrompe.
Compatibilidade
| Superfície | Status |
|---|---|
| Harness | DeepSeek Harness 0.1.2-alpha.5 (adaptado em 2026-09-02): o envelope de sessão mantém seu campo ignorable apenas para compatibilidade de leitura de logs armazenados - o Session.append ainda não consegue estampá-lo, então o comportamento da porta não muda. |
| Node | ^22.19.0 || >=24.0.0 |
| Navegador | Web Speech + MediaRecorder (melhor no Chrome/Edge); motores de transcrição/TTS do host para o resto |
O que você ganha
O dsh-talk fecha o loop de voz nos dois sentidos:
- Ferramenta
speak— o agente lê suas respostas em voz alta. Motores TTS: voz do navegador,edge-tts(vozes neurais em rede) oupiper(local). O áudio toca no navegador; nos hosts que podem transportá-lo, o registro de sessão guarda a fala saneada (ver Limites de segurança). - Botão de microfone — pressione, fale e a transcrição cai na caixa de entrada (ou envia direto). Motores STT: Web Speech do navegador (com resultados intermediários), um servidor HTTP FunASR ou
whisper.cpplocal. - Falar interrompe — começar a falar para a reprodução (canal client→host sobre o namespace
talk). - Anúncios de eventos — fim de turno, aprovações pendentes (seguro em cascata: nunca bloqueia o portão) e erros, com interruptor de mudo e frases configuráveis.
- Aba de configurações — seleção de motor/idioma e interruptores de anúncios, salvos como operações append-only do patch de perfil com backups.
Início rápido
# 1. instale o bundle no seu perfil
dsh plugin --profile web add "github:PerryLink/dsh-talk#main"
# ou pelo npm (versões publicadas)
dsh plugin --profile web add dsh-talk
# 2. reinicie e verifique a linha
dsh --profile web --dump-config | grep -A2 'id: talk'
Depois pressione o microfone ao lado do compositor e fale; ou peça ao agente para falar:
> Diga "olá" com a ferramenta speak.
Instalação e desinstalação
- Canal git (último
main):dsh plugin --profile web add "github:PerryLink/dsh-talk#main"— o scriptpreparecompila apenas com dependências de produção. - Canal npm (versões publicadas):
dsh plugin --profile web add dsh-talk. - Canal tarball:
pnpm packneste repositório e entãodsh plugin --profile web add ./dsh-talk-<version>.tgz. - Desinstalar:
dsh plugin --profile web remove dsh-talk(ou remova a linha do patch do perfil).
Se o pnpm reportar
ERR_PNPM_IGNORED_BUILDSpara este pacote (a validação inofensiva do binário do esbuild), adicioneallowBuilds: { esbuild: true }ao seupnpm-workspace.yaml— o CLIdshimprime o trecho exato.
Configuração
Todos os ajustes são campos Config do Schemastery (alteráveis pelo cordis.yml). O cordis.patch.yml documenta cada chave.
| Chave | Padrão | Significado |
|---|---|---|
record.enabled | true | Mostrar o botão de microfone do compositor |
record.hotkey | (nenhuma) | Atalho opcional, ex. "alt+r" |
record.maxSeconds | 60 | Limite de gravação em segundos (1..600) |
record.autoSubmit | false | Enviar a transcrição como mensagem do usuário (false = preencher o rascunho) |
record.vad.enabled / silenceMs / energyThreshold | true / 1500 / 0.01 | Detecção de atividade de voz: o silêncio encerra a gravação automaticamente (degrada para parada manual sem AudioContext) |
stt.engine | auto | auto / web / funasr / whisper; auto prefere um motor local configurado, depois Web Speech |
stt.language | auto | Idioma BCP-47 ou auto |
stt.interim | true | Mostrar transcrições intermediárias (Web Speech) |
stt.silenceFinaliseMs | 4000 | Parar o Web Speech contínuo após estes milissegundos sem fala (500..15000) |
stt.funasr.url | (nenhuma) | Endpoint de inferência FunASR; obrigatório com o motor funasr |
stt.whisper.modelPath | (nenhuma) | Modelo whisper.cpp; obrigatório com o motor whisper |
tts.engine | auto | auto / browser / edge-tts / piper; auto prefere piper, depois edge-tts, depois a voz do navegador |
tts.rate | 0 | Deslocamento de velocidade em porcentagem (-50..50) para edge-tts/piper |
tts.fallbackToBrowser | true | Cair para a voz do navegador quando um motor local falha |
tts.browser.voiceName | (nenhuma) | Nome preferido da voz do navegador; se não existir, usa o padrão da plataforma |
tts.browser.rate | 1 | Velocidade do SpeechSynthesis do navegador (0.1..10) |
tts.browser.pitch | 1 | Tom do SpeechSynthesis do navegador (0..2) |
tts.piper.modelPath | (nenhuma) | Modelo de voz piper; obrigatório com o motor piper |
announce.enabled | true | Interruptor mestre de anúncios |
announce.onTurnEnd / onApproval / onError | true | Quais eventos são falados |
announce.messages.* | "Turn complete." etc. | Frases faladas |
interrupt | true | Falar para a reprodução atual |
maxSpeakChars | 20000 | Limite do texto da ferramenta speak (1..100000) |
maxAudioCacheBytes | 8388608 | Limite da cache de áudio em memória (1 MiB..64 MiB) |
stt.silenceFinaliseMs e record.vad.silenceMs são mecanismos distintos: o primeiro finaliza a transcrição do Web Speech quando o reconhecimento contínuo deixa de ouvir fala; o segundo é o detetor por energia do MediaRecorder que encerra a gravação (e a envia quando record.autoSubmit está ativo). Correm em pipelines diferentes e não partilham estado.
Ferramentas e superfícies
| Superfície | Tipo | Notas |
|---|---|---|
speak | ferramenta | Lê texto em voz alta (browser/edge-tts/piper); overrides de motor/voz por chamada; resultado JSON canônico |
| botão de microfone | slot conversation.input.left | Gravar → transcrever → preencher rascunho (ou enviar); falar interrompe ao pressionar |
| aba de configurações | settings.plugins.tab (id talk) | Motores/idioma/anúncios; salvamento append-only |
talk:* | Typert Remote | status, audio, transcribe, applySettings, interrupt (namespace do host) |
Permissões e dados
- Permissões: o plugin guarda apenas uma cache de áudio em memória com limite de bytes; a permissão do microfone é mediada pelo navegador. A aba de configurações apenas anexa fragmentos ao patch do perfil com backup — nunca reescreve o arquivo.
- Dados: o áudio nunca entra no contexto do modelo nem no registro de sessão. Onde o vocabulário de sessão do host o aceita, o evento
dsh-talk/speechcarrega o id da fala, motor, razão, tamanho, texto saneado e, quando aplicável, voz, velocidade e tom do navegador; em hosts sem envelope o evento não é escrito. Toda superfície de exibição/registro redige credenciais, JWT, cabeçalhos bearer e caminhos temporários. - Rede: apenas os motores que você configurar são contatados.
edge-ttsfaz síntese pela rede, o FunASR usa seu endpoint configurado e owebkitSpeechRecognitiondo Chrome envia o áudio do microfone aos servidores do Google para transcrição; a reprodução despeechSynthesisdo navegador permanece local.
Limites de segurança
- Visível para o modelo ⟺ registrado — o modelo vê apenas o valor canônico e o texto renderizado da ferramenta speak. O evento
dsh-talk/speeché anexado apenas quando o host pode transportá-lo (ver Compatibilidade do host); os eventostool/call+tool/resultcontinuam sendo sempre o rastro reconstruível. - Anúncios de aprovação nunca bloqueiam — o listener de
approval/requestsempre chamanext(). - Saída saneada — credenciais e caminhos temporários de áudio nunca chegam a registros ou telas.
- Compatibilidade do host — o evento
dsh-talk/speeché anexado por uma comporta adaptativa. Hosts cujo vocabulário de tipos conhecidos cobre o evento o anexam diretamente; hosts com a opçãoignorableo anexam com a marca; hosts sem envelope — toda linha publicada até0.1.1-rc.2, e a linha0.1.2-alpha, cujo Session.append não consegue estampar o marcador ignorable embora o campo do envelope seja mantido para compatibilidade de leitura — não recebem nenhum append, de modo que a fala nunca pode poluir o registro de sessão nessas linhas. Neles o histórico de reprodução ao vivo fica vazio e os resultados da ferramenta speak são o rastro reconstruível. - Falha ruidosa — motores inválidos, valores fora de faixa e motores sem seu modelo/endpoint obrigatório falham ao montar.
Limitações conhecidas
- Suporte de navegador: Web Speech e MediaRecorder são detectados por capacidade; sem eles o botão desativa e os motores do host (FunASR/whisper.cpp) podem transcrever quando configurados.
- Motores locais são instalação sua: os executáveis e modelos de
edge-tts,piperewhisper.cppdevem ser instalados à parte. - Formato de gravação: o navegador grava com seu codec nativo do MediaRecorder; o whisper.cpp pode exigir um gravador WAV ou conversão no servidor.
- Configurações aplicam ao recarregar: a aba anexa ao patch do perfil; um reload do perfil (ou reinício da web) ativa as mudanças.
- O histórico de reprodução ao vivo fica vazio em hosts sem envelope: em
0.1.1-rc.2e na linha0.1.2-alphao vocabulário do host não conhecedsh-talk/speech, então a comporta não escreve nada e a lista de reprodução da sessão no cliente fica vazia. A fala em si, o microfone, a aba de configurações e a ferramenta não são afetados. - Registros antigos escritos pelo dsh-talk ≤ 0.2.1 podem exigir reparo antes do carregamento a frio: versões até
0.2.1anexavam eventosdsh-talk/speechsem marca. Em hosts0.1.0-rc.7ou mais recentes, uma sessão cujo registro já os contém falha no próximo carregamento a frio comSessionFormatUnsupportedError. Reparação: pare o host, faça cópia do registo.jsonlda sessão, acrescente"ignorable":truecomo membro de topo em cada linha JSON cujo"type"seja"dsh-talk/speech"(por exemplo, insira"ignorable":true,logo a seguir à{inicial) e reabra a sessão. Nada mais muda e nada se perde; novos appends desta versão nunca adicionam eventos sem marca.
Desenvolvimento
pnpm install # node ^22.19 || >=24
pnpm run typecheck # tsc: src + tests contra o checkout local do harness
pnpm run typecheck:ci # tsc contra os tipos publicados 0.1.2-alpha.5 (sem paths)
pnpm test # vitest: 77 testes, 13 suítes
pnpm run build # declarações tsc + bundles tsdown (lib/)
pnpm run verify:self-contained # as specs de dependências resolvem pelo registry
pnpm run verify:artifacts # faces ESM construídas + handshake ModuleLoader do cliente
pnpm pack # o tarball publicado
Topics
dsh, dsh-plugin, deepseek-harness, deepseek, cordis, voice, speech, tts, stt, speech-to-text, text-to-speech, microphone
Contributors
- @PerryLink — criador e mantenedor: pipeline de voz, motores de fala, gravador de microfone, anúncios de eventos, unidade de projeção e a documentação em cinco idiomas.
PerryLink DSH Plugin Family
Este projeto é um dos 33 plugins de DeepSeek Harness mantidos por PerryLink. Se este ajuda você, os outros provavelmente também:
| Plugin | One-liner |
|---|---|
| dsh-dsh-auto-review | Auto-revisão de segundo modelo na cadeia de aprovação, com falha fechada por padrão |
| dsh-dsh-background-agents | Agentes filhos em segundo plano duráveis com barra lateral de UI web, mensagens e interrupção |
| dsh-dsh-budget | Governança de custos para DeepSeek Harness: orçamentos, carbono e latência em um painel. |
| dsh-dsh-checkpoint-rewind | Equivalente ao /rewind do Claude Code: instantâneos, bifurcações de sessão, restauração de uso único |
| dsh-dsh-claude-move | Migre sessões, memória, habilidades e CLAUDE.md do Claude Code para o DSH |
| dsh-dsh-click | Controle de desktop nativo multiplataforma para DeepSeek Harness — Windows primeiro. |
| dsh-dsh-composer-history | Histórico de entrada estilo terminal para o compositor web: setas, busca Ctrl+R |
| dsh-dsh-data-quality | Verificações de qualidade de datasets e verificação de citações (a ponte numérica opcional consumida aqui) |
| dsh-dsh-defend | Defesa contra injeção de prompt, jailbreak e vazamento de segredos para DeepSeek Harness. |
| dsh-dsh-doublecheck | Guardião de disciplina de engenharia: sabatina de requisitos, portões de teste, revisão adversária |
| dsh-dsh-draw | Roteamento unificado de geração de imagens estáticas para DeepSeek Harness. |
| dsh-dsh-fast | Diagnóstico de desempenho só de leitura para DeepSeek Harness. |
| dsh-dsh-fund-research | Relatórios de pesquisa deterministas para fundos mútuos públicos chineses |
| dsh-dsh-github | Integração de PR/issues do GitHub para o DSH, cada escrita controlada por aprovação |
| dsh-dsh-industry-research | Orquestração de pesquisa setorial que sela as suas entregas através do ctx.researchReport.assemble deste plugin |
| dsh-dsh-library | Base de conhecimento documental local para DeepSeek Harness. |
| dsh-dsh-local-ai | Integração de modelos locais (Ollama) para DeepSeek Harness. |
| dsh-dsh-lsp-actions | Diagnósticos, formatação, autocompletar, ações de código e renomeação LSP sobre servidores de linguagem |
| dsh-dsh-mask | Middleware de mascaramento de PII: anonimiza no limite do modelo, restaura na camada de exibição |
| dsh-dsh-mcp-panel | Painel de tempo de execução MCP somente leitura: comando /mcp + aba Settings com status, ferramentas e erros |
| dsh-dsh-memento | Memória entre sessões controlada por aprovação: costura ctx.memory + SQLite + ferramenta de memória |
| dsh-dsh-observe | Exportador de observabilidade OpenTelemetry e Langfuse para DeepSeek Harness. |
| dsh-dsh-output-styles | Troca de estilo em tempo de execução equivalente ao outputStyles do Claude Code |
| dsh-dsh-permission-rules | Regras de permissão declarativas allow/deny/ask estilo Claude Code com auditoria |
| dsh-dsh-plugin-guide | Base de conhecimento de desenvolvimento de plugins como habilidade de agente sob demanda |
| dsh-dsh-research-report | Motor de relatórios de pesquisa verificáveis com evidência endereçada por conteúdo |
| dsh-dsh-score | Pontuação de qualidade multidimensional para plugins de DeepSeek Harness. |
| dsh-dsh-session-pin | Fixe sessões na barra lateral web com ordenação durável |
| dsh-dsh-session-sync | Sincronização de sessões entre dispositivos para DeepSeek Harness — um espelho git dedicado do seu armazenamento de sessões. |
| dsh-dsh-skill-pack-security | Pacote de habilidades de auditoria de segurança: varredura de segredos, revisão de dependências e cadeia de suprimentos |
| dsh-dsh-test-drive | Test drives isolados de instalação e smoke para plugins de DeepSeek Harness. |
| dsh-dsh-translate | Tradução de parâmetros entre fornecedores e reparo determinístico de JSON para DeepSeek Harness. |
License
Apache License 2.0 © 2026 dsh-talk contributors