آواتار Gemini 3.8 Live با قابلیت لبخوانی و واکنشهای طبیعی توسط گوگل معرفی شد. گوگل برای Gemini 3.8 Live چهرهای ساخته که میتواند لبخوانی کند، واکنش نشان دهد و در پسزمینه از ابزارها استفاده کند. در ادامهی این مقاله از سایت فری لرن، با قابلیتهای آواتار Gemini 3.8 Live آشنا میشویم.
قابلیتهای آواتار Gemini 3.8 Live
گوگل به Gemini Live چهره داده است. این شرکت Gemini 3.8 Live با قابلیت Live Avatar را معرفی کرده که هوش مصنوعی مکالمهای گوگل را با ویدئویی که تقریباً بهصورت لحظهای تولید میشود ترکیب میکند. این سیستم میتواند از طریق یک شخصیت بصری متحرک، صحبتهای کاربر را بشنود، محیط را ببیند، صحبت کند و واکنش نشان دهد.

این بهروزرسانی تنها حدود یک هفته پس از عرضه Gemini 3.8 Live و Live Extended Thinking در ۱۵ سپتامبر (۲۴ شهریور ۱۴۰۵) منتشر شده است. این مدلها بر استدلال قدرتمندتر، درک بهتر محتوای بصری و اجرای ابزارها در پسزمینه تمرکز داشتند. Live Avatar همین زیرساخت را حفظ کرده و یک لایه بصری به آن اضافه میکند؛ هرچند گوگل فعلاً این قابلیت را به Gemini Enterprise محدود کرده است.
حالا Gemini میتواند ظاهر مناسبی هم داشته باشد
Live Avatar با هدف نزدیکتر کردن مکالمات با هوش مصنوعی به گفتوگو با یک فرد واقعی در تماس ویدیویی طراحی شده است. آواتار میتواند با صدای تولیدشده توسط هوش مصنوعی هماهنگ با حرکت لبها صحبت کند، از حالات چهره استفاده کند و بدون مکثهای ناخوشایند بین جملات به کاربر پاسخ دهد.
گوگل انتظار دارد شرکتها از این قابلیت برای خدمات مشتری، آموزشهای تعاملی و موقعیتهای مشابه استفاده کنند؛ موقعیتهایی که صرفاً شنیدن صدای یک دستیار از بلندگو ممکن است کافی نباشد. این سیستم اطلاعات صوتی و تصویری را بهصورت همزمان پردازش میکند و به عامل هوش مصنوعی امکان میدهد در طول مکالمه، درک بیشتری از شرایط داشته باشد.

Live Avatar از ۹۷ زبان پشتیبانی میکند و میتواند همزمان با تغییر زبان، نحوه صحبت کردن، حرکت لبها و حالات چهره خود را نیز تنظیم کند؛ بدون اینکه گوگل اعلام کرده باشد کاربر برای تغییر زبان مجبور به شروع مجدد مکالمه است.
گوگل همچنین مجموعهای از آواتارهای از پیش آماده را در اختیار کاربران قرار میدهد. مشتریان سازمانی تأییدشده نیز میتوانند با استفاده از یک تصویر مرجع، آواتار سفارشی خودشان را بسازند. این آواتارهای سفارشی میتوانند شباهت ظاهری، سبک بصری یا هویت شخصیت موجود در تصویر اصلی را حفظ کنند.
آواتار فقط یک چهره سخنگو نیست
Live Avatar حتی هنگام ادامه مکالمه میتواند در پسزمینه از ابزارها استفاده کند و اطلاعات موردنیاز را دریافت کند. برای مثال، یک عامل هوش مصنوعی سازمانی میتواند در حین ادامه گفتوگو، اطلاعاتی را جستوجو کند یا یک سرویس متصل را فعال کند، بدون اینکه آواتار روی صفحه متوقف شود تا کاربر منتظر دریافت پاسخ بماند.
Gemini 3.8 Live با Live Avatar اکنون از طریق Gemini Enterprise در دسترس است. گوگل میگوید صدا و ویدئوی تولیدشده توسط این سیستم دارای واترمارک SynthID هستند. در حال حاضر، ساخت آواتارهای سفارشی نیز تنها برای کسبوکارهایی امکانپذیر است که مجوز دسترسی به این قابلیت را دریافت کردهاند.
همچنین بخوانید: کلید خاموشی هوش مصنوعی چیست؟ چرا Kill Switch هوش مصنوعی را خاموش نمیکند؟
