ElevenLabs مدل صوتی Eleven v4 را با صدایی طبیعی‌تر و احساسی‌تر معرفی کرد

شرکت ElevenLabs از مدل جدید تبدیل متن به گفتار خود با نام مدل صوتی Eleven v4 رونمایی کرد. این مدل علاوه بر سرعت بالاتر، درک بهتری از لحن، احساسات و فضای مکالمه دارد و می‌تواند متن را با حالت‌هایی طبیعی‌تر و شبیه گفتار انسان اجرا کند. در ادامه‌ی این مقاله از سایت آموزشی فری لرن، با قابلیت‌های این مدل جدید هوش مصنوعی آشنا خواهیم شد.

قابلیت‌های مدل صوتی Eleven v4

یکی از قابلیت‌های مهم Eleven v4، کنترل دقیق نحوه بیان جملات است. کاربران می‌توانند با توضیحات متنی یا برچسب‌هایی مانند خندیدن، صحبت کردن با عصبانیت، لهجه خاص یا حتی افکت‌های صوتی، نحوه اجرای صدا را مشخص کنند.

Eleven v4 همچنین در مکالمات چندنفره عملکرد بهتری دارد و می‌تواند ویژگی‌های صدای هر شخصیت را در طول مکالمه حفظ کند. این مدل با درک بهتر زمینه یک صحنه، دیالوگ‌ها را طبیعی‌تر تولید می‌کند و صرفاً جملات جداگانه را به یکدیگر متصل نمی‌کند.

Eleven v4 Turbo برای مکالمات سریع

ElevenLabs در کنار نسخه اصلی، Eleven v4 Turbo را نیز معرفی کرده است. این نسخه برای ساخت دستیارهای صوتی و مکالمات بلادرنگ طراحی شده و طبق اعلام شرکت، می‌تواند اولین پاسخ صوتی را به‌طور میانگین در حدود ۱۰۰ میلی‌ثانیه تولید کند.

ترکیب سرعت بالا با لحن و احساس طبیعی، می‌تواند کاربرد این مدل‌ها را در دستیارهای صوتی، خدمات مشتری، بازی‌ها، آموزش و سایر سرویس‌های مبتنی بر صدا افزایش دهد.

پشتیبانی از بیش از ۹۰ زبان

Eleven v4 از بیش از ۹۰ زبان پشتیبانی می‌کند؛ در حالی که Eleven v3 از حدود ۷۰ زبان پشتیبانی می‌کرد. شرکت ElevenLabs می‌گوید کیفیت و طبیعی بودن صدا در زبان‌هایی مانند ژاپنی، ماندارین و پرتغالی برزیلی بهبود قابل توجهی داشته است.

این مدل هوش مصنوعی همچنین می‌تواند زبان و لهجه یک صدا را تغییر دهد و در عین حال ویژگی‌هایی مانند زیر و بمی و جنس صدای اصلی را حفظ کند.

ElevenLabs اعلام کرده مدل‌های جدید با استانداردهای امنیتی و حریم خصوصی از جمله GDPR، HIPAA، SOC 2 و PCI سازگار هستند و برای جلوگیری از سوءاستفاده از قابلیت شبیه‌سازی صدا نیز محدودیت‌هایی در نظر گرفته شده است.

پاسخی بگذارید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *