OpenAI veröffentlicht neue Sprachmodelle für natürlichere Konversationen

2026-07-08 · kamil

OpenAI hat neue Konversationsmodelle namens GPT-Live-1 und GPT-Live-1 mini veröffentlicht. Diese Modelle sollen natürlicher klingen und den Wechsel zwischen Gesprächspartnern (Turn-Taking) besser handhaben können. Als sogenannte Full-Duplex-Modelle sind sie in der Lage, gleichzeitig zu sprechen und zuzuhören. Dies erlaubt Nutzern, auf natürliche Weise zu unterbrechen und ermöglicht Funktionen wie die Live-Übersetzung.

Das Unternehmen ersetzt seinen bestehenden erweiterten Sprachmodus in ChatGPT standardmäßig durch GPT-Live-1 mini. Nutzer kostenpflichtiger Abonnements erhalten Zugriff auf das größere GPT-Live-1 Modell. Das Vorgängermodell kombinierte ein Spracherkennungsmodell zur Transkription, ein großes Sprachmodell zur Generierung von Antworten und ein Text-zu-Sprache-Modell für die Ausgabe.

Verbesserte Interaktion und Intelligenz

Laut OpenAI lösen die neuen Modelle Probleme wie das Unterbrechen von Nutzern während des Sprechens und eine unzureichende Intelligenz bei der Beantwortung von Fragen. Die neuen Modelle senden Anfragen an die aktuellsten Textmodelle des Unternehmens, wie GPT-5.5, für Such-, Denk- oder Agentenfunktionen, während die Konversation fortgesetzt wird. Die Modelle können auch über längere Zeiträume still bleiben und den Gesprächskontext aufnehmen, bis sie angesprochen werden. Da der neue Sprachmodus Zugriff auf neuere GPT-Modelle hat, kann er Informationen auch visuell präsentieren.

OpenAI beabsichtigt, dass der neue Sprachmodus in ChatGPT längere Gespräche ermöglicht. Atty Eleti, Produktleiter für ChatGPT Voice, berichtete bei einem Briefing von 30- bis 40-minütigen Gesprächen mit der Sprachfunktion während Spaziergängen. OpenAI sieht Sprache als die primäre Schnittstelle zur Computerbedienung für komplexe Aufgaben. Berichten zufolge könnte das Unternehmen in diesem Jahr KI-fähige Ohrhörer auf den Markt bringen, gab dazu jedoch keine weiteren Informationen.

Marktumfeld und Einschränkungen

OpenAI hat in den letzten Jahren an der Stärkung sprachbasierter Funktionen gearbeitet, um den Sprachmodus von ChatGPT natürlicher klingen zu lassen. Mehr als 150 Millionen Menschen nutzen bereits Funktionen wie Sprache und Diktat mit ChatGPT.

Auch Wettbewerber bemühen sich, ihre Assistenten ausdrucksstärker zu gestalten. Apple und Amazon haben ihre Assistenten aktualisiert, um konversationsfähiger zu sein und den Kontext besser zu verarbeiten. Startups wie Monogram und Sesame arbeiten ebenfalls an interaktiveren und natürlicheren KI-Assistenten.

Obwohl OpenAI angibt, dass der neue Sprachmodus natürlicher klingt, betonte das Unternehmen, dass er nicht als KI-Begleiter konzipiert ist. Die neuen Modelle verfügen über integrierte Schutzmechanismen, um altersgerechte Antworten für Teenager zu geben und Ressourcen bereitzustellen, wenn sich das Gespräch auf Themen wie Selbstverletzung konzentriert.

Der neue Sprachmodus erfordert jedoch noch weitere Entwicklungen. Bei einer Demonstration der Live-Übersetzungsfunktion ins Hindi hatte der Assistent einen starken amerikanischen Akzent und sprach Hindi mit einem unnatürlichen, leicht buchsprachlichen Ton. OpenAI erklärte, der neue Modus sei für die „meistgesprochenen Sprachen“ optimiert, nannte aber keine spezifischen Beispiele.


Thema: OpenAI. Quelle/Inspiration: TechCrunch.

← Zurück zu Aktuelles

Ähnliche Artikel