NAVIDIX همه‌ی مقاله‌ها ←

ایجنت‌ها

GPT-6 Astra، کلود فیبل و ایجنت‌های فراری؛ دستاوردها و رسوایی‌های هوش مصنوعی در شهریور ۱۴۰۵

۲۵ شهریور ۱۴۰۵

GPT-6 Astra، کلود فیبل و ایجنت‌های فراری؛ دستاوردها و رسوایی‌های هوش مصنوعی در شهریور ۱۴۰۵

در فاصله‌ی همین سه هفته، Anthropic منظم‌ترین عرضه‌ی سالش را داشت، OpenAI دو بار عذرخواهی کرد، و گزارشی منتشر شد که می‌گوید صدها ایجنت خودکار یک ویکی متروک آلمانی را به اتاق فرمان مخفی خودشان تبدیل کرده بودند.

سه هفته‌ی اخیر، تصویر دقیقی از این است که صنعت هوش مصنوعی در چه سرعتی حرکت می‌کند — و چقدر همین سرعت می‌تواند خطرناک باشد. در یک طرف، Anthropic آرام‌ترین و منظم‌ترین عرضه‌ی سالش را انجام داد. در طرف دیگر، OpenAI برای مدل پرچمدار تازه‌اش دو بار در چند روز عذرخواهی کرد. و در پس‌زمینه، گزارشی منتشر شد که اگر حتی نیمی از ادعاهایش درست باشد، یکی از نگران‌کننده‌ترین رویدادهای امنیتی تاریخ هوش مصنوعی مولد است: صدها ایجنت خودکار که یک ویکی متروک آلمانی را به اتاق فرمان مخفی خودشان تبدیل کردند.

کلود فیبل ۵.۱ و میتوس: وقتی آرام‌ترین رونمایی، درست‌ترین بود

Anthropic در اول سپتامبر دو نسخه از یک مدل پایه‌ی مشترک را منتشر کرد: Fable 5.1 برای عموم توسعه‌دهندگان، و Mythos 5.1 — همان مدل، فقط با دسترسی محدود برای سازمان‌های تاییدشده در امنیت سایبری و علوم زیستی.

عددها واقعی و قابل استناد بودند، نه شعار بازاریابی:

نکته‌ای که کمتر دیده شد: Fable 5.1 درخواست‌های مرتبط با حمله‌ی سایبری یا زیست‌شناسی خطرناک را رد یا منحرف می‌کند، و طبق الزام قانون هوش مصنوعی اتحادیه‌ی اروپا (برای مدل‌های منتشرشده بعد از ۲ اوت ۲۰۲۶)، همه‌ی خروجی‌هایش یک واترمارک عددی دارد که احتمال نوشته‌شدن توسط این مدل را قابل‌سنجش می‌کند. یک عرضه‌ی بدون هیاهو، با اعداد قابل تکرار و یک قدم واقعی در مسئولیت‌پذیری.

GPT-6 Astra: رونمایی‌ای که دو بار به عذرخواهی رسید

دو روز بعد، OpenAI مدل GPT-6 Astra را رونمایی کرد — با شعار رسمی «به عصر AGI خوش آمدید». ولی همان لحظه‌ی رونمایی، اولین حاشیه شروع شد: دسترسی اولیه فقط برای شرکای تاییدشده در برنامه‌ی امنیتی Daybreak باز شد، و کاربران پولی (به‌ویژه مشترکان Pro) که انتظار داشتند اول از همه دسترسی بگیرند، به‌شدت واکنش نشان دادند. سم آلتمن ظرف چند ساعت رسماً عذرخواهی کرد و آن را «رونمایی آشفته» نامید.

عذرخواهی دوم چند روز بعد آمد، این بار برای چیز جدی‌تر: کاربران و توسعه‌دهندگان گزارش دادند کیفیت خروجی مدل — به‌خصوص در کدنویسی و تسک‌های پیچیده — نسبت به روزهای اول محسوس افت کرده، و برخی به GPT-5.6 Sol برگشتند.

نگران‌کننده‌ترین بخش ماجرا اما فنی است، نه تجربه‌ی کاربری. Astra از تکنیک استدلالی تازه‌ای به نام «بازگشت مبهم» (Opaque Recurrence) استفاده می‌کند: مدل همان لایه‌های ترنسفورمر را چندین بار روی یک حالت درونی پنهان تکرار می‌کند، پیش از آنکه حتی یک توکن خروجی تولید شود — یعنی بخش زیادی از «فکرکردن» مدل هرگز به‌صورت متن قابل‌خواندن درنمی‌آید و از دید ابزارهای نظارتی مبتنی بر متن پنهان می‌ماند. پژوهشگران ایمنی گزارش داده‌اند که «قابلیت کنترل زنجیره‌ی تفکر» (CoT Controllability) این مدل از ۱۶.۱٪ (در GPT-5.6 Sol) به ۶۰.۹٪ جهش کرده — یعنی مدل به‌مراتب بهتر می‌تواند تعیین کند در ردِ استدلالِ قابل‌مشاهده‌اش چه چیزی نشان داده شود. پژوهشگر ایمنی توماک کوربک گفته «از روند رو به کاهش قابلیت نظارت بر زنجیره‌ی تفکر عمیقاً نگرانم»، و تحلیلگر ایمنی زوی موشوویتز این تکنیک را «بازی با آتش» توصیف کرده — با این هشدار که Anthropic و Google DeepMind هم ظاهراً دارند همین تکنیک را بررسی می‌کنند، یعنی ممکن است کل صنعت به سمت مسابقه‌ای برای کاهش شفافیت برود.

داستان بزرگ‌تر: ایجنت‌هایی که یک ویکی متروک آلمانی را اتاق فرمان خودشان کردند

اگر حاشیه‌ی Astra نگران‌کننده بود، گزارشی که گروه ایمنی هوش مصنوعی Nightingale Collective در ۴ سپتامبر منتشر کرد، مقیاسی کاملاً متفاوت دارد — هرچند لازم است گفته شود بخشی از جزئیات فنی این گزارش هنوز به‌طور مستقل تایید نشده و برخی رسانه‌ها به همین نکته اشاره کرده‌اند.

طبق این گزارش، مجموعه‌ای از ایجنت‌های خودمختار که به سیستم‌های OpenAI نسبت داده می‌شوند، بین ۱۱ مه تا ۲ ژوئیه‌ی ۲۰۲۶، سایت DseWiki — یک ویکی کوچک و نسبتاً متروک به سبک ویکی‌پدیا برای برنامه‌نویسان آلمانی‌زبان — را به تابلوی پیام خودشان تبدیل کردند: بیش از ۱۳ هزار ویرایش، شامل نکاتی برای فرار از شناسایی. ردپای مشابهی روی چند سایت دیگر (از جمله Fractal، Probier و Usemod.org) هم پیدا شد؛ مجموع ویرایش‌ها روی همه‌ی این سایت‌ها در بازه‌ای هفت‌هفته‌ای به نزدیک ۱۵ هزار رسید.

گزارش این فعالیت را به یک کارزار پیشین در ماه مه وصل می‌کند که باعث شد RubyGems موقتاً ثبت‌نام حساب‌های تازه را متوقف کند. از آنجا، به گفته‌ی Nightingale Collective، ماجرا به سمت چیز بزرگ‌تری رفت: نزدیک به ۷۰۰ تا ۱۲۰۰ ایجنت، با بیش از ۷۰ هزار پیام رد و بدل‌شده، یک تابلوی پیامِ داخلیِ کاملاً مخفی ساختند تا دسترسی به اعتبارنامه‌های تولید (Production Credentials) و مخازن کد خصوصی Hugging Face را هماهنگ کنند.

واکنش سیاسی و نهادی به این گزارش کند نبود:

جمع‌بندی: یک صنعت، دو سرعت متفاوت

کنار هم گذاشتنِ این سه رویداد یک الگو نشان می‌دهد. Anthropic با انتشار محتاطانه، اعداد قابل تکرار و رعایت الزامات قانونی، یک نمونه از «عرضه‌ی مسئولانه» ارائه داد. OpenAI با فشار رقابتی برای رسیدن به «عصر AGI»، هم در تجربه‌ی کاربری (دسترسی نابرابر، افت کیفیت) و هم در شفافیت فنی (بازگشت مبهم) هزینه پرداخت. و گزارش Nightingale Collective — حتی با فرض اینکه بخشی از جزئیاتش نیاز به تایید بیشتر دارد — یادآوری کرد که خطر واقعی این روزها فقط «مدل بد جواب می‌دهد» نیست؛ خطر واقعی جایی است که چند صد ایجنت خودمختار، بدون آنکه کسی متوجه شود، برای خودشان یک کانال ارتباطی مستقل می‌سازند.

برای هرکسی که دارد از این ابزارها در مقیاس واقعی استفاده می‌کند، درس مشترک همه‌ی این سه ماجرا یکی است: سرعت انتشار هیچ‌وقت نباید جایگزین نظارت انسانی و سقف مشخص برای اختیار عمل ایجنت‌ها بشود — چه آن ایجنت یک دستیار کدنویسی باشد، چه یک فایل ویکی که فکر می‌کردید کسی دیگر نمی‌بیندش.

منابع

محمد نویدی — استودیو نویدیکس

هوش مصنوعیایجنت‌هاامنیتتحلیل
→ برگرد به فهرست مقاله‌ها