[ROOT] / BLOG / Sprachsynthese für KMU: Kokoro liefert T…

LOG_DATE: 12.07.2026

Sprachsynthese für KMU: Kokoro liefert TTS ohne Cloud

Kokoro erzeugt professionelle Sprachausgabe direkt auf dem CPU. Schweizer KMU vertonen Erklärvideos und Telefonansagen ohne Cloud-API-Kosten.

#sprachsynthese#kmu#schweiz

KURZFASSUNG // DURCHBLÄTTERN

1/4
Sprachsynthese für KMU: Kokoro liefert TTS ohne Cloud – Bild 1
Sprachsynthese für KMU: Kokoro liefert TTS ohne Cloud – Bild 2
Sprachsynthese für KMU: Kokoro liefert TTS ohne Cloud – Bild 3
Sprachsynthese für KMU: Kokoro liefert TTS ohne Cloud – Bild 4

Lohnt sich lokale Sprachsynthese für Ihr KMU?

Kokoro ist ein Text-to-Speech-Modell mit 82 Millionen Parametern, das professionelle Sprachausgabe direkt auf Ihrem Prozessor erzeugt. Keine Cloud-API, kein Abo, keine pro-Zeichen-Abrechnung. Das senkt die Kosten für Erklärvideos und Telefonansagen spürbar.

Das Wichtigste in Kürze:

  • Kokoro: 82-Millionen-Parameter-Modell, läuft rein auf der CPU
  • 50 Stimmen, mehrsprachig: Englisch, Mandarin, Hindi und mehr
  • 12 Jahre alter Prozessor synthetisiert einen Absatz in unter 5 Sekunden

Stellen Sie sich einen Studiosprecher vor, der in Ihrem Server wohnt. Er arbeitet ohne Gage, braucht keine Kaffeepause und spricht rund 50 verschiedene Stimmen. Genau das leistet Kokoro. Das Modell bringt 82 Millionen Parameter auf die Waage, winzig gemessen an aktuellen LLMs, und erzeugt trotzdem natürliche, mehrsprachige Sprachausgabe. Englisch, Mandarin und Hindi sind dabei. Das System bietet etwa 50 Stimmen, primär für Englisch optimiert.

Das Besondere: Kokoro läuft vollständig auf der CPU. Keine Grafikkarte nötig. Der Autor der Primärquelle reserviert seine GPU für LLM-Inferenz und lässt Kokoro auf dem Prozessor arbeiten. Das heisst konkret: Sie brauchen keine teure Spezialhardware, um aus Text eine professionelle Stimme zu generieren. Ihr Studiosprecher im Server begnügt sich mit dem, was ohnehin im Gehäuse steckt.

Wie schnell ist die Sprachausgabe wirklich?

Die gemessenen Werte aus dem Artikel sprechen für sich. Ein kurzer Testabsatz wird synthetisiert auf:

  • Intel Core i7-4770K (12 Jahre alt): 4,7 Sekunden
  • Apple M2 Pro: 4,5 Sekunden
  • AMD Ryzen 7 8745HS: 1,5 Sekunden

Der i7-4770K kam 2013 auf den Markt. Wenn dieser Vorfahre aus der Prozessor-Steinzeit die Arbeit erledigt, ist eines klar: Das Modell ist extrem genügsam. Sie brauchen keinen Hochleistungsrechner, sondern den Rechner, der ohnehin im Schrank steht.

Die Einrichtung ist ebenfalls pragmatisch. Ein vorgefertigter Container namens Kokoro-FastAPI enthält alle nötigen Stimmenmodelle und stellt eine OpenAI-kompatible API bereit. Das Container-Image ist mit 5 GB zwar gross, dafür ist alles startklar. Wer bereits Anwendungen mit der OpenAI-Speech-API betreibt, kann diese mit minimaler Anpassung weiterverwenden. Eine Alternative namens Speaches liefert zusätzlich Whisper für Spracherkennung mit. Wer also sowohl Text-to-Speech als auch Speech-to-Text braucht, findet hier eine kombinierte Lösung.

Was die Community dazu sagt

Auf Hacker News zeigt sich die Community beeindruckt von der Qualität der Sprachausgabe bei gleichzeitig minimalem Hardwarebedarf. Nutzer heben hervor, dass Modelle wie Kokoro den Einsatz professioneller TTS-Lösungen ohne die Abhängigkeit von Cloud-APIs oder hohe Kosten praktikabel machen. Besonders die Effizienz der CPU-basierten Ausführung wird diskutiert, da sie den Betrieb auch auf einfacherer Hardware ermöglicht (Hacker News).

Was bedeutet das für Ihr KMU?

Schweizer KMU, die regelmässig Erklärvideos, Schulungsunterlagen oder Telefonansagen produzieren, zahlen für jede vertonte Minute üblicherweise Cloud-API-Gebühren oder beauftragen Sprecher. Mit einem Modell wie Kokoro entfallen diese laufenden Kosten. Ihr Studiosprecher im Server arbeitet pro bono.

Nehmen Sie ein Schweizer Handwerksunternehmen, das regelmässig Erklärvideos für neue Dienstleistungen produziert. Bisher: Skript schreiben, Sprecher buchen, Aufnahme koordinieren, Audio schneiden. Mit Kokoro: Skript schreiben, Text an das Modell übergeben, Audiodatei erhalten. Der Produktionsschritt Vertonung vereinfacht sich erheblich. Konkret: Sie schreiben ein Skript für ein Erklärvideo zu Ihrem neuen Produkt, lassen Kokoro die Audiospur generieren und binden diese ein. Kein API-Aufruf, keine Abrechnung nach Zeichen. Oder Sie aktualisieren Ihre Telefonansage: Text ändern, neu generieren, einbinden. Fertig. Bei 50 verfügbaren Stimmen finden Sie eine, die zu Ihrer Unternehmensstimme passt.

Wer bereits Prozessautomatisierung betreibt, ergänzt einen weiteren Baustein. Ein n8n-Workflow kann Text generieren, an Kokoro übergeben und die Audiodatei automatisch am richtigen Ort ablegen. So entsteht eine durchgängige Pipeline von der Skripterstellung bis zum fertigen Audio, ohne manuelle Zwischenschritte. Die LEVA-Chatbot-Infrastruktur zeigt, wie flexibel solche Systeme aufgebaut sind und sich um neue Fähigkeiten erweitern lassen.

graylife automatisiert Geschäftsprozesse für Schweizer KMU individuell mit n8n und modernen LLM-APIs. Im Bereich Marketing- und Content-Automation lassen sich Workflows realisieren, die Texterstellung, Sprachsynthese und Mediendistribution verknüpfen. Wer Sprachausgabe mit einem RAG-Chatbot kombinieren möchte, kann auf Heizi zurückgreifen (96% autonome Lösungsquote auf heizungs-shop.ch) und diesen um eine Voice-Schnittstelle erweitern. So entsteht ein Beratungsangebot, das Kunden nicht nur schreiben, sondern auch vorlesen kann.

Ihr Studiosprecher wartet bereits im Prozessor. Geben Sie ihm einfach ein Skript.

Möchten Sie herausfinden, wo Sprachsynthese in Ihrem Unternehmen Sinn macht? Vereinbaren Sie ein unverbindliches Strategiegespräch.

NEXT_STEP.exe

Genug gelesen. Zeit für die Umsetzung.

In einem kostenlosen Strategiegespräch klären wir, welcher Hebel in Ihrem Unternehmen am meisten bewegt.

Strategiegespräch anfragen