Richtlinie · Workflows & Automatisierung
Claude mit der eigenen Stimme verbinden
Worum es geht
Die meisten Voice-Agenten klingen glatt: keine Betonung, keine Emotion. Hier klonst du deine eigene Stimme bei Fish Audio, lässt Claude in deinem Sprachstil formulieren und baust daraus einen Agenten. Die Kette ist immer dieselbe: deine Eingabe (Text oder Mikrofon), optional Spracherkennung, Claude formuliert die Antwort, Fish Audio spricht sie mit deiner Stimm-ID, heraus kommt eine MP3, eine Nachricht im Messenger oder ein Telefongespräch.
Zur Einordnung: Voice Cloning liefert nur die Klangvorlage mit einer ID, Text-to-Speech macht daraus Audio, ein Voice-Agent führt ein Echtzeitgespräch, ein Telefon-Agent braucht zusätzlich Rufnummer, Ansage und Übergabe an Menschen.
Für wen das sinnvoll ist
- Betriebe, die Sprachnachrichten, Formularantworten oder Newsletter in der eigenen Stimme vertonen wollen – ohne Code, mit n8n.
- Wer in zehn Minuten sehen will, ob ihm das Ergebnis gefällt: Claude-Connector.
- Wer ein echtes Telefongespräch braucht: Echtzeit-Agent, mehrere Tage Aufwand, Entwicklerarbeit.
Für alle Wege brauchst du ein Claude-Konto, ein Fish-Audio-Konto, eine saubere Aufnahme deiner Stimme und die Zustimmung der aufgenommenen Person.
So gehst du vor
- Sprachstil definieren. Lade einem Claude-Projekt echte Texte hoch (Mails, Nachrichten, Blogtexte) und speichere das Ergebnis als Projektanweisung.
Analysiere ausschließlich die Gespräche und Textbeispiele, auf die du in diesem Projekt tatsächlich Zugriff hast. Erstelle daraus ein kompaktes Sprachprofil. Beschreibe Satzlänge, Wortwahl, Direktheit, Humor, typische Formulierungen und Dinge, die ich normalerweise vermeide. Erfinde keine Eigenschaften, für die es keine Beispiele gibt.- Schlüssel anlegen. Den API-Schlüssel erzeugst du im Fish-Audio-Konto unter API Keys. Schlüssel gehören in Umgebungsvariablen (
FISH_API_KEY,ANTHROPIC_API_KEY,FISH_VOICE_ID), nie in eine Webseite oder ein Git-Repository. - Aufnahme machen. Eine Person, ruhiger Raum, gleichmäßige Lautstärke, ein bis zwei Minuten. Keine Musik, kein Hall, keine Sprachnachrichten. Formate:
.wav,.mp3,.m4a,.opus. - Stimme klonen. Bei Fish Audio den Bereich Voice Cloning öffnen, Aufnahmen hochladen, Namen vergeben, Sichtbarkeit auf private lassen, Modell erstellen, auf Status trained warten, Voice-ID kopieren. Alternativ per Terminal:
curl --request POST https://api.fish.audio/model \
--header "Authorization: Bearer $FISH_API_KEY" \
--form type=tts \
--form title="Meine Stimme" \
--form "description=Private persönliche Stimme" \
--form visibility=private \
--form train_mode=fast \
--form voices=@stimme.wavFISH_VOICE_ID=hier-die-erzeugte-modell-id- Stimme testen.
curl --request POST https://api.fish.audio/v1/tts \
--header "Authorization: Bearer $FISH_API_KEY" \
--header "Content-Type: application/json" \
--header "model: s2.1-pro-free" \
--data '{
"text": "Hallo, dies ist ein Test meiner geklonten Stimme.",
"reference_id": "FISH_VOICE_ID",
"format": "mp3",
"prosody": {
"speed": 1,
"volume": 0,
"normalize_loudness": true
}
}' \
--output test.mp3- Betonung steuern. Klingt der Bot flach, liegt es am Text: kurze Sätze, echte Satzzeichen, Zahlen ausgeschrieben. Regieanweisungen in eckigen Klammern setzt du sparsam genau dort, wo die Wirkung anfangen soll.
Also gut. [kurze Pause] Ich fasse das noch mal zusammen.
Wir hatten zwei Termine offen [nachdenklich] und einen davon
hast du gestern abgesagt. [freundlich] Passt Donnerstag?Variante A: n8n ohne Programmierung
In n8n unter Settings, Community Nodes das Paket n8n-nodes-fishaudio installieren, Zugangsdaten vom Typ Fish Audio API anlegen. Dann: Trigger (Webhook, Formular, Chat oder Audiodatei), bei Sprache eine Speech-to-Text-Stufe, ein AI-Agent-Knoten mit Claude und diesem Systemprompt, dahinter der Fish-Audio-Knoten im Modus Text-to-Speech mit deiner Voice-ID.
Du bist ein deutschsprachiger Voice-Agent für [ZWECK].
Aufgaben:
- Beantworte Fragen kurz und konkret.
- Verwende meistens ein bis drei gesprochene Sätze.
- Stelle genau eine Rückfrage, wenn wichtige Angaben fehlen.
- Behaupte nie, eine Aktion ausgeführt zu haben, wenn kein
Tool-Ergebnis vorliegt.
- Lies keine API-Schlüssel, internen IDs oder technischen
Fehlermeldungen laut vor.
- Formuliere Zahlen, Abkürzungen und Datumsangaben so, dass
sie natürlich ausgesprochen werden.
- Weise zu Beginn eines Anrufs transparent darauf hin, dass
du ein KI-Sprachassistent bist.
- Übergib das Gespräch an einen Menschen, wenn der Nutzer
dies verlangt oder du die Aufgabe nicht zuverlässig
lösen kannst.
Sprechstil:
[HIER DAS ZUVOR ERSTELLTE SPRACHPROFIL EINFÜGEN]Variante B: Fish Audio als Claude-Connector
In Claude unter Einstellungen, Connectors auf Add custom connector klicken, Name „Fish Audio", MCP-Server https://api.fish.audio/mcp, OAuth-Anmeldung durchführen, im neuen Chat über das Plus-Menü aktivieren. Drei Testprompts:
Nutze den aktivierten Fish-Audio-Connector und erzeuge aus folgendem Text eine MP3-Datei: „Hallo, dies ist meine erste Sprachausgabe aus Claude."
Verwende meine private Fish-Audio-Stimme mit der Voice-ID FISH_VOICE_ID und erzeuge eine deutsche Sprachausgabe.
Formuliere zuerst eine kurze Antwort in meinem hinterlegten Schreibstil. Erzeuge anschließend mit Fish Audio eine Audiodatei dieser Antwort.Optional als Projektanweisung:
Wenn ich ausdrücklich „als Audio" schreibe, formuliere zuerst eine kurze Antwort und verwende anschließend den aktivierten Fish-Audio-Connector, um daraus eine Audiodatei mit meiner privaten Stimme zu erzeugen. Verwende keine andere Stimme und veröffentliche meine Voice-ID nicht.Variante C: Echtzeit-Agent
Fish Audio liefert nur die Sprachsynthese; Gesprächslogik, Unterbrechungen und Telefonanbindung orchestriert LiveKit Agents (Alternative: Pipecat).
pip install "livekit-agents[fishaudio]"
pip install anthropicexport FISH_API_KEY="dein-fish-audio-api-key"
export ANTHROPIC_API_KEY="dein-anthropic-api-key"
export FISH_VOICE_ID="deine-private-voice-id"import os
from livekit.plugins.fishaudio import TTS
fish_tts = TTS(
reference_id=os.environ["FISH_VOICE_ID"],
sample_rate=24000,
latency_mode="balanced",
)Audio als PCM oder Opus streamen, Unterbrechungen erlauben, zuerst im Browser testen. Telefonie (Rufnummer, Datenschutzansage, Einwilligung bei Aufzeichnung, Übergabe an Mitarbeiter, Kostenlimits) kommt erst dazu, wenn das Gespräch dort sauber läuft.
Stolpersteine
- 401 Unauthorized: Schlüssel fehlt oder ist ungültig. Umgebungsvariable prüfen, Schlüssel neu erzeugen.
- reference_id invalid: Falsche Voice-ID oder Modell noch nicht trained. ID direkt aus der API-Antwort oder aus My Voices kopieren.
- Claude sieht Fish Audio nicht: Connector im aktuellen Chat über das Plus-Menü einschalten.
- Claude erzeugt nur Text: Die Spracherzeugung muss ausdrücklich angefordert werden. Der Connector erzeugt Dateien, keine automatische Sprachausgabe.
- Agent zu langsam: Streaming aktivieren, Antworten kürzen, an Satzgrenzen übergeben.
- Modellnamen:
s2.1-pro-freeist eine veränderliche Angabe, das LiveKit-Plugin führt eine eigene Liste. Vor dem Produktivstart die Preis- und Limitseite prüfen. - Recht: Nur die eigene oder ausdrücklich freigegebene Stimme klonen, die KI-Stimme offenlegen, Voice-ID nicht veröffentlichen. Eine geklonte Stimme ist ein biometrisches Merkmal – ein Passwort, das du nicht ändern kannst.
Passt nichts davon, teste den nackten cURL-Aufruf aus Schritt 5. Funktioniert der, liegt der Fehler in deinem Workflow.
Werkzeuge und Kosten
Fish Audio nennt s2.1-pro als Produktionsmodell und s2.1-pro-free als gleiches Modell zum Preis von null, unter Fair-Use-Grenzen und ohne Garantie für Antwortzeit. Für den Connector brauchst du keinen API-Schlüssel. n8n, LiveKit Agents oder Pipecat kommen je nach Weg dazu.
Weiterlesen in Workflows & Automatisierung