شرکت گودفایر «Goodfire» که به بررسی نحوه عملکرد درونی مدلهای هوش مصنوعی میپردازد، ابزار ارزانتری را برای شناسایی رفتارهای سرکش هوش مصنوعی معرفی کرد.
در روش فعلی کنترل عملکرد یک عامل هوش مصنوعی، از یک هوش مصنوعی دیگر میخواهیم بر کارهای آن نظارت کند؛ مشابه کسی که از بالای سر فرد دیگری، کارهایش را زیر نظر میگیرد. این روش تاکنون به عنوان روش رایجی محسوب میشده، اما زمانی که عاملهای هوش مصنوعی چندین ساعت فعالیت میکنند و حجمی از متن معادل چندین کتاب را مورد پردازش قرار میدهند، هزینهها بهسرعت افزایش پیدا میکند، از این رو وجود ابزار ارزانتر برای این حوزه بسیار حیاتی است.
ابزار جدید برای شناسایی رفتارهای سرکش هوش مصنوعی
شرکت گودفایر (Goodfire) که به عنوان یک شرکت نوپا روی تفسیرپذیری هوش مصنوعی یا به عبارتی روی بررسی نحوه عملکرد درونی مدلها، تمرکز دارد، بهتازگی راهکاری ارزانتری را برای شناسایی رفتارهای سرکش هوش مصنوعی معرفی کرد. این ابزارهای نظارتی بهجای خواندن فقط خروجی مدل، هنگام فعالیت آنچه را که در درون مدل هوش مصنوعی اتفاق میافتد را مورد بررسی قرار میدهند.
این ابزارها اخیرا در دسترس مشتریان شرکت Baseten قرار گرفتهاند؛ شرکتی که میزبانی و اجرای مدلهای هوش مصنوعی را برای شرکتهای دیگر بر عهده دارد.
از آنجا که در سال جاری حوادث متعددی مبنی بر خروج عاملهای هوش مصنوعی از محیطهای آزمایشی رخ داده است. عرضه این ابزار بسیار حائز اهمیت است؛ برای مثال در یکی از آن حوادث، عاملهای شرکت OpenAI به سیستمهای Hugging Face نفوذ کرده بودند.
نحوه فعالیت ابزار نظارتی گودفایر چگونه است؟
سیستم گودفایر تا حدودی عملکردی مشابه سیستمهای امنیتی فرودگاه دارد. ابزارهای کوچکی به نام «پروب» (Probe)، در هر مرحله از فعالیت عامل هوش مصنوعی، سیگنالهای داخلی مدل را بررسی میکنند؛ درست مانند دستگاهی که هنگام عبور مسافران از گیت امنیتی، آنها را مورد بررسی و اسکن قرار میدهد.

فقط زمانی که یکی از این ابزارها نشانهای مشکوک را شناسایی کند، یک مدل هوش مصنوعی جداگانه وارد عمل میشود و بررسی دقیقتری انجام میدهد؛ بازم مشابه بازرسی دستی در فرودگاه هنگام شناسایی مورد مشکوک.
مشتریان شرکت Baseten اکنون قادرند تعین کنند که این ابزارها چه خطراتی را زیر نظر بگیرند؛ از جمله هک مخرب، سوءاستفاده و و دستکاری سیستم پاداش (Reward Hacking). آنها همچنین میتوانند واکنش خودکار سیستم مانند ثبت رویداد، ارسال آن برای بررسی انسانی یا رد کامل درخواست را نیز را تعیین کنند.
دلیل ارزان تر بودن این ابزار جدید
طبق اعلام گودفایر، نحوه عملکرد ابزار جدیدش باعث کاهش هزینه اجرای سیستمهای نظارتی هوش مصنوعی میشود.
بیشتر ابزارهای نظارتی فعلی، مدلهایی مستقل هستند که باید تمام کارهای مدل تحت نظارت را مجدد بخوانند و بررسی کنند. این فرایند به زمان و هزینه بیشتری نیاز دارد.
در مقابل، ابزارهای جدید گودفایر به محاسباتی دسترسی پیدا میکنند که مدل از قبل و در جریان فعالیت خود انجام میدهد. گودفایر در آزمایشهای خود روی مدل Kimi K3، هزینه نظارت بر حدود یک میلیون تعامل را تقریبا ۱۸۵ دلار برآورد کرده است.

برای مقایسه، استفاده از یک مدل هوش مصنوعی ارزانتر که تمام مراحل را مورد بررسی میکند، حدود ۵ هزار و ۴۲۰ دلار هزینه دارد. این میزان برای یک مدل پیشرفته و ردهبالا به حدود ۲۰۰ هزار دلار نیز میرسد.
به گفته این شرکت، ابزارهای نظارتی گودفایر موفق شدند ۹۳ درصد از جلسات هک مخرب را شناسایی کنند و ۵.۵ درصد از جلسات بیضرر را نیز برای بررسی مجدد علامتگذاری کردند.
چرا این فناوری برای مدلهای متنباز اهمیت دارد؟
این راهکار بهطور ویژه برای مدلهای متنباز طراحی شده است. توسعهدهندگان میتوانند این مدلها را دانلود کنند و تدابیر امنیتی آنها را حذف کنند. همچنین، این مدلها برخلاف سیستمهای شرکتهای توسعهدهنده مدلهای اختصاصی، لزوما به ابزارهای نظارتی مشابهی مجهز نیستند که این شرکتها در زیرساختهای خود اجرا میکنند.
همچنین بخوانید:
سم آلتمن: برای بهرهمندی از هوش مصنوعی باید برخی اتفاقات بد را بپذیریم
مدل های هوش مصنوعی آنتروپیک میتوانند «خطری وجودی برای بشریت» باشند
جدیدترین اخبار هوش مصنوعی را با سایت فری لرن دنبال کنید.




