آواتار Gemini 3.8 Live با قابلیت لب‌خوانی و واکنش‌های طبیعی معرفی شد

آواتار Gemini 3.8 Live با قابلیت لب‌خوانی و واکنش‌های طبیعی توسط گوگل معرفی شد. گوگل برای Gemini 3.8 Live چهره‌ای ساخته که می‌تواند لب‌خوانی کند، واکنش نشان دهد و در پس‌زمینه از ابزارها استفاده کند. در ادامه‌ی این مقاله از سایت فری لرن، با قابلیت‌های آواتار Gemini 3.8 Live آشنا می‌شویم.

قابلیت‌های آواتار Gemini 3.8 Live

گوگل به Gemini Live چهره داده است. این شرکت Gemini 3.8 Live با قابلیت Live Avatar را معرفی کرده که هوش مصنوعی مکالمه‌ای گوگل را با ویدئویی که تقریباً به‌صورت لحظه‌ای تولید می‌شود ترکیب می‌کند. این سیستم می‌تواند از طریق یک شخصیت بصری متحرک، صحبت‌های کاربر را بشنود، محیط را ببیند، صحبت کند و واکنش نشان دهد.

آواتار Gemini 3.8 Live با قابلیت لب‌خوانی و واکنش‌های طبیعی معرفی شد

این به‌روزرسانی تنها حدود یک هفته پس از عرضه Gemini 3.8 Live و Live Extended Thinking در ۱۵ سپتامبر (۲۴ شهریور ۱۴۰۵) منتشر شده است. این مدل‌ها بر استدلال قدرتمندتر، درک بهتر محتوای بصری و اجرای ابزارها در پس‌زمینه تمرکز داشتند. Live Avatar همین زیرساخت را حفظ کرده و یک لایه بصری به آن اضافه می‌کند؛ هرچند گوگل فعلاً این قابلیت را به Gemini Enterprise محدود کرده است.

حالا Gemini می‌تواند ظاهر مناسبی هم داشته باشد

Live Avatar با هدف نزدیک‌تر کردن مکالمات با هوش مصنوعی به گفت‌وگو با یک فرد واقعی در تماس ویدیویی طراحی شده است. آواتار می‌تواند با صدای تولیدشده توسط هوش مصنوعی هماهنگ با حرکت لب‌ها صحبت کند، از حالات چهره استفاده کند و بدون مکث‌های ناخوشایند بین جملات به کاربر پاسخ دهد.

گوگل انتظار دارد شرکت‌ها از این قابلیت برای خدمات مشتری، آموزش‌های تعاملی و موقعیت‌های مشابه استفاده کنند؛ موقعیت‌هایی که صرفاً شنیدن صدای یک دستیار از بلندگو ممکن است کافی نباشد. این سیستم اطلاعات صوتی و تصویری را به‌صورت هم‌زمان پردازش می‌کند و به عامل هوش مصنوعی امکان می‌دهد در طول مکالمه، درک بیشتری از شرایط داشته باشد.

آواتار Gemini 3.8 Live با قابلیت لب‌خوانی و واکنش‌های طبیعی معرفی شد

Live Avatar از ۹۷ زبان پشتیبانی می‌کند و می‌تواند هم‌زمان با تغییر زبان، نحوه صحبت کردن، حرکت لب‌ها و حالات چهره خود را نیز تنظیم کند؛ بدون اینکه گوگل اعلام کرده باشد کاربر برای تغییر زبان مجبور به شروع مجدد مکالمه است.

گوگل همچنین مجموعه‌ای از آواتارهای از پیش آماده را در اختیار کاربران قرار می‌دهد. مشتریان سازمانی تأییدشده نیز می‌توانند با استفاده از یک تصویر مرجع، آواتار سفارشی خودشان را بسازند. این آواتارهای سفارشی می‌توانند شباهت ظاهری، سبک بصری یا هویت شخصیت موجود در تصویر اصلی را حفظ کنند.

آواتار فقط یک چهره سخنگو نیست

Live Avatar حتی هنگام ادامه مکالمه می‌تواند در پس‌زمینه از ابزارها استفاده کند و اطلاعات موردنیاز را دریافت کند. برای مثال، یک عامل هوش مصنوعی سازمانی می‌تواند در حین ادامه گفت‌وگو، اطلاعاتی را جست‌وجو کند یا یک سرویس متصل را فعال کند، بدون اینکه آواتار روی صفحه متوقف شود تا کاربر منتظر دریافت پاسخ بماند.

Gemini 3.8 Live با Live Avatar اکنون از طریق Gemini Enterprise در دسترس است. گوگل می‌گوید صدا و ویدئوی تولیدشده توسط این سیستم دارای واترمارک SynthID هستند. در حال حاضر، ساخت آواتارهای سفارشی نیز تنها برای کسب‌وکارهایی امکان‌پذیر است که مجوز دسترسی به این قابلیت را دریافت کرده‌اند.

همچنین بخوانید: کلید خاموشی هوش مصنوعی چیست؟ چرا Kill Switch هوش مصنوعی را خاموش نمی‌کند؟

پاسخی بگذارید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *