شرکت ElevenLabs از مدل جدید تبدیل متن به گفتار خود با نام مدل صوتی Eleven v4 رونمایی کرد. این مدل علاوه بر سرعت بالاتر، درک بهتری از لحن، احساسات و فضای مکالمه دارد و میتواند متن را با حالتهایی طبیعیتر و شبیه گفتار انسان اجرا کند. در ادامهی این مقاله از سایت آموزشی فری لرن، با قابلیتهای این مدل جدید هوش مصنوعی آشنا خواهیم شد.
قابلیتهای مدل صوتی Eleven v4
یکی از قابلیتهای مهم Eleven v4، کنترل دقیق نحوه بیان جملات است. کاربران میتوانند با توضیحات متنی یا برچسبهایی مانند خندیدن، صحبت کردن با عصبانیت، لهجه خاص یا حتی افکتهای صوتی، نحوه اجرای صدا را مشخص کنند.
Eleven v4 همچنین در مکالمات چندنفره عملکرد بهتری دارد و میتواند ویژگیهای صدای هر شخصیت را در طول مکالمه حفظ کند. این مدل با درک بهتر زمینه یک صحنه، دیالوگها را طبیعیتر تولید میکند و صرفاً جملات جداگانه را به یکدیگر متصل نمیکند.
Eleven v4 Turbo برای مکالمات سریع
ElevenLabs در کنار نسخه اصلی، Eleven v4 Turbo را نیز معرفی کرده است. این نسخه برای ساخت دستیارهای صوتی و مکالمات بلادرنگ طراحی شده و طبق اعلام شرکت، میتواند اولین پاسخ صوتی را بهطور میانگین در حدود ۱۰۰ میلیثانیه تولید کند.
ترکیب سرعت بالا با لحن و احساس طبیعی، میتواند کاربرد این مدلها را در دستیارهای صوتی، خدمات مشتری، بازیها، آموزش و سایر سرویسهای مبتنی بر صدا افزایش دهد.
پشتیبانی از بیش از ۹۰ زبان
Eleven v4 از بیش از ۹۰ زبان پشتیبانی میکند؛ در حالی که Eleven v3 از حدود ۷۰ زبان پشتیبانی میکرد. شرکت ElevenLabs میگوید کیفیت و طبیعی بودن صدا در زبانهایی مانند ژاپنی، ماندارین و پرتغالی برزیلی بهبود قابل توجهی داشته است.
این مدل هوش مصنوعی همچنین میتواند زبان و لهجه یک صدا را تغییر دهد و در عین حال ویژگیهایی مانند زیر و بمی و جنس صدای اصلی را حفظ کند.
ElevenLabs اعلام کرده مدلهای جدید با استانداردهای امنیتی و حریم خصوصی از جمله GDPR، HIPAA، SOC 2 و PCI سازگار هستند و برای جلوگیری از سوءاستفاده از قابلیت شبیهسازی صدا نیز محدودیتهایی در نظر گرفته شده است.
