گودفایر ابزار ارزان‌تری برای شناسایی رفتارهای سرکش هوش مصنوعی معرفی کرد

شرکت گودفایر «Goodfire» که به بررسی نحوه عملکرد درونی مدل‌های هوش مصنوعی می‌پردازد، ابزار ارزان‌تری را برای شناسایی رفتارهای سرکش هوش مصنوعی معرفی کرد.

در روش فعلی کنترل عملکرد یک عامل هوش مصنوعی، از یک هوش مصنوعی دیگر می‌خواهیم بر کارهای آن نظارت کند؛ مشابه کسی که از بالای سر فرد دیگری، کارهایش را زیر نظر می‌گیرد. این روش تاکنون به عنوان روش رایجی محسوب می‌شده، اما زمانی که عامل‌های هوش مصنوعی چندین ساعت فعالیت می‌کنند و حجمی از متن معادل چندین کتاب را مورد پردازش قرار می‌دهند، هزینه‌ها به‌سرعت افزایش پیدا می‌کند، از این رو وجود ابزار ارزان‌تر برای این حوزه بسیار حیاتی است.

ابزار جدید برای شناسایی رفتارهای سرکش هوش مصنوعی

شرکت گودفایر (Goodfire) که به عنوان یک شرکت نوپا روی تفسیرپذیری هوش مصنوعی یا به عبارتی روی بررسی نحوه عملکرد درونی مدل‌ها، تمرکز دارد، به‌تازگی راهکاری ارزان‌تری را برای شناسایی رفتارهای سرکش هوش مصنوعی معرفی کرد. این ابزارهای نظارتی به‌جای خواندن فقط خروجی مدل، هنگام فعالیت آنچه را که در درون مدل هوش مصنوعی اتفاق می‌افتد را مورد بررسی قرار می‌دهند.

این ابزارها اخیرا در دسترس مشتریان شرکت Baseten قرار گرفته‌اند؛ شرکتی که میزبانی و اجرای مدل‌های هوش مصنوعی را برای شرکت‌های دیگر بر عهده دارد.

از آنجا که در سال جاری حوادث متعددی مبنی بر خروج عامل‌های هوش مصنوعی از محیط‌های آزمایشی رخ داده است. عرضه این ابزار بسیار حائز اهمیت است؛ برای مثال در یکی از آن حوادث، عامل‌های شرکت OpenAI به سیستم‌های Hugging Face نفوذ کرده بودند.

نحوه فعالیت ابزار نظارتی گودفایر چگونه است؟

سیستم گودفایر تا حدودی عملکردی مشابه سیستم‌های امنیتی فرودگاه دارد. ابزارهای کوچکی به نام «پروب» (Probe)، در هر مرحله از فعالیت عامل هوش مصنوعی، سیگنال‌های داخلی مدل را بررسی می‌کنند؛ درست مانند دستگاهی که هنگام عبور مسافران از گیت امنیتی، آن‌ها را مورد بررسی و اسکن قرار می‌دهد.

گودفایر ابزار ارزان‌تری برای شناسایی رفتارهای سرکش هوش مصنوعی معرفی کرد

فقط زمانی که یکی از این ابزارها نشانه‌ای مشکوک را شناسایی کند، یک مدل هوش مصنوعی جداگانه وارد عمل می‌شود و بررسی دقیق‌تری انجام می‌دهد؛ بازم مشابه بازرسی دستی در فرودگاه هنگام شناسایی مورد مشکوک.

مشتریان شرکت Baseten اکنون قادرند تعین کنند که این ابزارها چه خطراتی را زیر نظر بگیرند؛ از جمله هک مخرب، سوءاستفاده و و دست‌کاری سیستم پاداش (Reward Hacking). آن‌ها همچنین می‌توانند واکنش خودکار سیستم مانند ثبت رویداد، ارسال آن برای بررسی انسانی یا رد کامل درخواست را نیز را تعیین کنند.

دلیل ارزان تر بودن این ابزار جدید

طبق اعلام گودفایر، نحوه عملکرد ابزار جدیدش باعث کاهش هزینه اجرای سیستم‌های نظارتی هوش مصنوعی می‌شود.

بیشتر ابزارهای نظارتی فعلی، مدل‌هایی مستقل هستند که باید تمام کارهای مدل تحت نظارت را مجدد بخوانند و بررسی کنند. این فرایند به زمان و هزینه بیشتری نیاز دارد.

در مقابل، ابزارهای جدید گودفایر به محاسباتی دسترسی پیدا می‌کنند که مدل از قبل و در جریان فعالیت خود انجام می‌دهد. گودفایر در آزمایش‌های خود روی مدل Kimi K3، هزینه نظارت بر حدود یک میلیون تعامل را تقریبا ۱۸۵ دلار برآورد کرده است.

گودفایر ابزار ارزان‌تری برای شناسایی رفتارهای سرکش هوش مصنوعی معرفی کرد

برای مقایسه، استفاده از یک مدل هوش مصنوعی ارزان‌تر که تمام مراحل را مورد بررسی می‌کند، حدود ۵ هزار و ۴۲۰ دلار هزینه دارد. این میزان برای یک مدل پیشرفته و رده‌بالا به حدود ۲۰۰ هزار دلار نیز می‌رسد.

به گفته این شرکت، ابزارهای نظارتی گودفایر موفق شدند ۹۳ درصد از جلسات هک مخرب را شناسایی کنند و ۵.۵ درصد از جلسات بی‌ضرر را نیز برای بررسی مجدد علامت‌گذاری کردند.

چرا این فناوری برای مدل‌های متن‌باز اهمیت دارد؟

این راهکار به‌طور ویژه برای مدل‌های متن‌باز طراحی شده است. توسعه‌دهندگان می‌توانند این مدل‌ها را دانلود کنند و تدابیر امنیتی آن‌ها را حذف کنند. همچنین، این مدل‌ها برخلاف سیستم‌های شرکت‌های توسعه‌دهنده مدل‌های اختصاصی، لزوما به ابزارهای نظارتی مشابهی مجهز نیستند که این شرکت‌ها در زیرساخت‌های خود اجرا می‌کنند.

همچنین بخوانید:

سم آلتمن: برای بهره‌مندی از هوش مصنوعی باید برخی اتفاقات بد را بپذیریم

مدل های هوش مصنوعی آنتروپیک می‌توانند «خطری وجودی برای بشریت» باشند

جدیدترین اخبار هوش مصنوعی را با سایت فری لرن دنبال کنید.

پاسخی بگذارید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *