Süper Zeka 1 dk okuma

Microsoft AI ses modelleri tanıtıldı: 100 milisaniyede deşifre

Microsoft AI, gerçek zamanlı deşifre ve ses klonlama yeteneklerine sahip yeni yapay zekâ ses modellerini kullanıma sundu.

100 msdeşifre gecikmesi

Öne çıkanlar

  1. Microsoft AI, 60 dili destekleyen gerçek zamanlı deşifre modeli MAI-Transcribe-2-Streaming'i sundu.
  2. Metinden konuşma üreten MAI-Voice-2.1 modeli, tek bir sesle 23 farklı dili aksanlı konuşabiliyor.
  3. Yeni ses modelleri, birkaç saniyelik ses kaydıyla ses klonlama yapabilme yeteneğine sahip.

Microsoft AI, sesli asistanlar ve gerçek zamanlı uygulamalar için geliştirdiği yeni microsoft ai ses modelleri sistemlerini duyurdu. Şirket; anlık metin dönüştürme odaklı MAI-Transcribe-2-Streaming modelinin yanı sıra metinden konuşma üreten MAI-Voice-2.1 ve MAI-Voice-2.1-Flash modellerini yayınladı.

Microsoft AI ses modelleri neler sunuyor?

Microsoft AI'ın açıklamasına göre MAI-Transcribe-2-Streaming, 60 dili destekliyor ve ilk kısmi deşifre sonuçlarını 100 milisaniyenin biraz üzerinde bir sürede teslim edebiliyor. Şirket, modelin Artificial Analysis doğruluk sıralamasında birinci sırada yer aldığını bildirdi. Modelin saatlik kullanım ücreti yıl sonuna kadar geçerli tanıtım fiyatıyla 0,54 dolar olarak belirlendi.

Metinden konuşma üreten MAI-Voice-2.1 ise aynı sesi kullanarak 23 farklı dilde doğal aksanla konuşabiliyor. Daha hızlı çalışan MAI-Voice-2.1-Flash varyantı 150 milisaniye gecikme süresine sahip ve milyon karakter başına 22 dolar yerine 15 dolar maliyetle sunuluyor.

Ses klonlama yeteneği ve erişim

Her iki ses sentezi modeli de sadece birkaç saniyelik referans kaydından ses klonlama gerçekleştirebiliyor. Kötüye kullanımı engellemek amacıyla sistemlere yerleşik güvenlik önlemleri eklendi. Yapılan bir testte, 4.000 katılımcının yaklaşık yarısı üretilen yapay sesleri gerçek bir insana ait zannetti. Modeller Microsoft Foundry ve MAI Playground üzerinden, iki ses sentezi modeli ise ek olarak OpenRouter platformundan erişime açıldı.

Kaynaklar

  1. The DecoderMicrosoft AI releases new transcription and text-to-speech models for voice agents

Bu haber, yukarıdaki kaynaklardan yapay zeka yardımıyla Türkçe derlenmiş ve editör onayıyla yayımlanmıştır.Fotoğraflar, altlarında belirtilen kaynaklara aittir. Ayrıntılar ve orijinal ifadeler için kaynaklara başvurun. Bir hata görürseniz bize bildirin.

İlgili haberler.

Tümü