ChatGPT’nin Yeni Sesi: OpenAI, Kesintisiz İki Yönlü Konuşma İçin GPT-Live’ı Yayınladı

openai, 8 Temmuz 2026’da gpt-live adlı yeni full-duplex ses modeli ailesini duyurdu. gpt-live-1 ve gpt-live-1 mini, Advanced Voice Mode’un yerini alarak aynı anda dinleme ve konuşma yapabiliyor; haftalık 150 milyondan fazla ChatGPT ses kullanıcısını doğrudan etkiliyor. Bu lansman, gpt-56 gibi metin modeli güncellemelerinden mimari olarak tamamen ayrı bir ses devrimi.

Ana Gelişme

OpenAI’nin resmi duyurusuna göre gpt-live, turn-based (sıra tabanlı) Advanced Voice Mode’u varsayılan olarak değiştiriyor. Yeni mimari, kullanıcının konuşmasını kesmeden yanıt verebiliyor; duraklamaları algılayıp canlı çeviri sunabiliyor. Karmaşık görevler arka planda gpt-56 tabanlı frontier modellere delegasyon yapılırken konuşma akışı kesintisiz sürüyor.

Katman dağılımı şöyle:

KatmanHedef kullanıcıModel
Go, Plus, ProÜcretli abonelerGPT-Live-1
FreeÜcretsiz kullanıcılarGPT-Live-1 mini

API erişimi “yakında” planlanıyor; lansman gününde geliştiriciler için public API henüz mevcut değil.

Eski vs yeni mimari

Eski pipeline (Advanced Voice Mode):

  1. STT (speech-to-text) — konuşmayı metne çevir
  2. LLM — metin üzerinde reasoning
  3. TTS (text-to-speech) — yanıtı sese dönüştür

Bu sıralı yapı, kullanıcının model bitirmesini beklemeyi ve kesintisiz diyaloğu zorlaştırıyordu.

Yeni mimari (full-duplex-voice):

  • Eşzamanlı dinleme ve konuşma
  • Kesinti ve duraklama algılama
  • Arka planda frontier model delegasyonu
  • Canlı çeviri desteği

Neden Önemli?

foundation-models yarışında ses arayüzü, metin yetenekleri kadar kritik hâle geldi. chatgpt’nin 150 milyondan fazla haftalık ses kullanıcısı, bu mimari değişimin anında milyonlarca kişiyi etkileyeceği anlamına geliyor.

Türk geliştiriciler ve AI meraklıları için pratik etkiler:

  • Ücretsiz katman: GPT-Live-1 mini ile temel full-duplex deneyimi
  • Ücretli katmanlar: Daha yetenekli GPT-Live-1 ile gelişmiş çeviri ve kesinti yönetimi
  • Yaklaşan API: Voice-enabled uygulamalar için yeni entegrasyon fırsatları

Teknik Detaylar ve Kısıtlar

OpenAI, lansman kapsamında bazı sınırlamaları açıkça belirtti:

  • Video ve screen sharing desteklenmiyor
  • Dil desteği sınırlı; tüm dillerde tam çeviri garantisi yok
  • API henüz yayınlanmadı — kesin tarih verilmedi

multimodal-ai bağlamında gpt-live, sesi metin modellerinden bağımsız bir mimari katman olarak konumlanıyor. Bu ayrım, gpt-56 lansmanıyla karıştırılmaması gereken önemli bir teknik fark.

Bağlam

openai, son yıllarda ses deneyimini kademeli olarak geliştirdi: önce basit voice input, ardından Advanced Voice Mode, şimdi full-duplex gpt-live. Rakipler de benzer yönde ilerliyor; ancak 150M+ haftalık kullanıcı tabanı bu değişimi en geniş kitleye ulaştıran lansman yapıyor.

Ses verisi gizliliği açısından kısa bir not: full-duplex mimari, sürekli dinleme davranışını doğal konuşma akışının parçası hâline getiriyor. Kullanıcıların ses akışlarının nasıl işlendiği, saklandığı ve silindiği konusunda OpenAI’nin veri politikalarını gözden geçirmesi önerilir.

Sonraki Adımlar

  • API lansmanı: Geliştiriciler için public API erişimi — tarih henüz açıklanmadı
  • Dil genişlemesi: Sınırlı dil desteğinin genişletilmesi
  • Video entegrasyonu: Screen sharing ve multimodal özelliklerin eklenmesi
  • Rekabet yanıtları: Diğer frontier lab’lerin full-duplex ses hamleleri

gpt-live, ChatGPT’nin ses deneyimini sıra tabanlı pipeline’dan sürekli diyaloğa taşıyan mimari bir dönüm noktası. Metin modeli lansmanlarından farklı olarak, bu değişim bugünden itibaren tüm ChatGPT katmanlarında aktif.


Kaynaklar