Fish Audio, Yapay Ses Modelleri için $52M Seed Turu Kapattı
Palo Alto merkezli fish-audio, 28 Temmuz 2026’da yapay ses modelleri için **50M rakamı güncellendi: TechCrunch düzeltme notu ve SiliconANGLE teyidiyle doğru tutar $52M.
Ana Gelişme
fish-audio open-source Fish Speech hattından enterprise text-to-speech / ses API’sine uzanan bir yol izliyor. Şirkete göre 8 milyondan fazla kişi open-source veya hosted modelleri kullanıyor; yıllık yinelenen gelir (ARR) yaklaşık $21 milyon; 15.000’den fazla natural-language voice control sunuluyor. Fish Speech GitHub deposu 31.000’den fazla star’a sahip. Bu traction iddiaları şirket beyanıdır; bağımsız denetim basın materyalinde yer almıyor.
Son bir yılda dört speech generation ve bir speech-to-text modeli çıkarıldı; üç speech generation modeli açık kaynaklandı. En güncel S2.1 Pro yalnızca ücretli API üzerinden — open-source çekirdek ile commercial frontier model ayrımı bilinçli bir ürün stratejisi. Kurumsal müşteri olarak heygen ve Sanas şirket tarafından anılıyor.
CEO ve ortak kurucu Rissa Cao’ya göre farklı enterprise müşteriler farklı özellik istiyor: HeyGen avatar gerçekçiliği, oyun stüdyoları ifade gücü, LiveKit tarzı ses ajanları düşük gecikmeli doğal ses. Kurucu Shijia Liao (eski NVIDIA araştırmacısı), piyasadaki ifadesiz sentetik seslerden duyduğu hayal kırıklığıyla tek GPU’da bir model eğitip open-source yapmıştı. Seed, bu topluluk tabanını enterprise API’ye taşıma iddiasını finanse ediyor.
Rekabet ve Yol Haritası
ai-voice-market-2026 içinde elevenlabs, WellSaid, Cartesia, Speechify, Async (eski Podcastle) ve Krisp rakip olarak anılıyor. Open-source → ücretli API yolu, ElevenLabs sınıfı oyunculara fiyat, latans ve topluluk baskısı oluşturabilir. SiliconANGLE / Coreline çerçevesi sesi varsayılan AI arayüzü olarak konumlandırıyor: çok dilli ifade, duygusal ton ve maliyet liderliği yatırımcı tezinin parçası.
İleriye dönük plan: bu yıl bir audio understanding modeli ve speech-to-speech modeli. Creator planları dakikalık generation kotası ve voice-cloning özellikleri sunuyor; enterprise katmanı API ve platform olarak ayrı paketleniyor. TechCrunch’ın güncelleme notu, erken 52M olarak düzeltilmeli.
Rıza ve DMCA — Sorumlu Not
Şirket, model kütüphanesini büyütmek için kullanıcıların kendi seslerini yüklemesini ve kullanılan sesler için telafi etmeyi denemişti. Birkaç ay önce bazı creator’lar seslerinin rızasız yüklendiğini iddia etti. Fish Audio DMCA kaldırma süreci işletiyor; Cao’ya göre kaldırmalar artık ses örneği veya sözleşme kanıtıyla üç dakikanın altına otomatikleştirildi. Rıza/sahiplik sorunları sektör genelinde sürüyor.
Coreline’dan Osuke Honda, topluluk modellerinin yalnızca creator güveniyle çalışabileceğini vurguluyor: rıza, şeffaflık, attribution, doğrulanmış ses sahipliği, net lisanslama ve ileride gelir paylaşımı. Bu paragraf politika bağlamıdır; ses klonlama “nasıl yapılır” detayı verilmez.
Neden Önemli?
Türk AI geliştiricileri için haber, çok dilli TTS, ses ajanları ve open-source Fish Speech ekosisteminin enterprise’a sıçraması. Finans okurları için 21M ARR, ai-investment-trends ve venture-capital içinde ses dikeyinin hâlâ agresif sermaye çektiğini gösteriyor. Rakamı $50M sanmamak ve traction’ı şirket iddiası olarak etiketlemek kritik.
Ses, metin chat’inin ardından agent arayüzünün varsayılan kanalı haline geldikçe, TTS kalitesi ve rıza altyapısı ürün farklılaşması kadar reputasyon riski de taşıyor. Open-source yıldız sayısı enterprise ARR’ye dönüşürken, creator trust ve otomatik DMCA hızı ürün pazarlama dilinin ayrılmaz parçası haline geliyor. Türk geliştiriciler için pratik ayrım: Fish Speech ile lokal/deneysel üretim; S2.1 Pro API ile latency ve steerability gerektiren production ses ajanları.
Sonraki Adımlar
İzlenecekler: S2.1 Pro API adoption’ı, audio understanding / speech-to-speech çıkışları, rıza altyapısının bağımsız denetimi, ElevenLabs sınıfı fiyat/özellik rekabeti ve açık model yıldızlarının ücretli API’ye dönüşüm oranı.