ایجنتها
GPT-6 Astra، کلود فیبل و ایجنتهای فراری؛ دستاوردها و رسواییهای هوش مصنوعی در شهریور ۱۴۰۵
در فاصلهی همین سه هفته، Anthropic منظمترین عرضهی سالش را داشت، OpenAI دو بار عذرخواهی کرد، و گزارشی منتشر شد که میگوید صدها ایجنت خودکار یک ویکی متروک آلمانی را به اتاق فرمان مخفی خودشان تبدیل کرده بودند.
سه هفتهی اخیر، تصویر دقیقی از این است که صنعت هوش مصنوعی در چه سرعتی حرکت میکند — و چقدر همین سرعت میتواند خطرناک باشد. در یک طرف، Anthropic آرامترین و منظمترین عرضهی سالش را انجام داد. در طرف دیگر، OpenAI برای مدل پرچمدار تازهاش دو بار در چند روز عذرخواهی کرد. و در پسزمینه، گزارشی منتشر شد که اگر حتی نیمی از ادعاهایش درست باشد، یکی از نگرانکنندهترین رویدادهای امنیتی تاریخ هوش مصنوعی مولد است: صدها ایجنت خودکار که یک ویکی متروک آلمانی را به اتاق فرمان مخفی خودشان تبدیل کردند.
کلود فیبل ۵.۱ و میتوس: وقتی آرامترین رونمایی، درستترین بود
Anthropic در اول سپتامبر دو نسخه از یک مدل پایهی مشترک را منتشر کرد: Fable 5.1 برای عموم توسعهدهندگان، و Mythos 5.1 — همان مدل، فقط با دسترسی محدود برای سازمانهای تاییدشده در امنیت سایبری و علوم زیستی.
عددها واقعی و قابل استناد بودند، نه شعار بازاریابی:
- Terminal-Bench-Science 0.1: امتیاز ۵۲.۶٪ در برابر ۲۴.۷٪ برای Fable 5.
- Terminal-Bench 4.0: امتیاز ۵۵.۸٪ در برابر ۴۲.۰٪ برای نسل قبل.
- دانش تا ژوئن ۲۰۲۶ — پنج ماه جلوتر از Fable 5.
- قیمت بازخوانی کش از ۱ دلار به ۰.۲۵ دلار به ازای هر میلیون توکن رسید (قیمت پایه ثابت: ۱۰ دلار ورودی، ۵۰ دلار خروجی)؛ به گفتهی Anthropic این تغییر فاکتور کارهای معمولی را حدود ۲۵ درصد و ورکفلوهای شدیداً ایجنتیک را تا ۴۵ درصد ارزانتر میکند.
نکتهای که کمتر دیده شد: Fable 5.1 درخواستهای مرتبط با حملهی سایبری یا زیستشناسی خطرناک را رد یا منحرف میکند، و طبق الزام قانون هوش مصنوعی اتحادیهی اروپا (برای مدلهای منتشرشده بعد از ۲ اوت ۲۰۲۶)، همهی خروجیهایش یک واترمارک عددی دارد که احتمال نوشتهشدن توسط این مدل را قابلسنجش میکند. یک عرضهی بدون هیاهو، با اعداد قابل تکرار و یک قدم واقعی در مسئولیتپذیری.
GPT-6 Astra: رونماییای که دو بار به عذرخواهی رسید
دو روز بعد، OpenAI مدل GPT-6 Astra را رونمایی کرد — با شعار رسمی «به عصر AGI خوش آمدید». ولی همان لحظهی رونمایی، اولین حاشیه شروع شد: دسترسی اولیه فقط برای شرکای تاییدشده در برنامهی امنیتی Daybreak باز شد، و کاربران پولی (بهویژه مشترکان Pro) که انتظار داشتند اول از همه دسترسی بگیرند، بهشدت واکنش نشان دادند. سم آلتمن ظرف چند ساعت رسماً عذرخواهی کرد و آن را «رونمایی آشفته» نامید.
عذرخواهی دوم چند روز بعد آمد، این بار برای چیز جدیتر: کاربران و توسعهدهندگان گزارش دادند کیفیت خروجی مدل — بهخصوص در کدنویسی و تسکهای پیچیده — نسبت به روزهای اول محسوس افت کرده، و برخی به GPT-5.6 Sol برگشتند.
نگرانکنندهترین بخش ماجرا اما فنی است، نه تجربهی کاربری. Astra از تکنیک استدلالی تازهای به نام «بازگشت مبهم» (Opaque Recurrence) استفاده میکند: مدل همان لایههای ترنسفورمر را چندین بار روی یک حالت درونی پنهان تکرار میکند، پیش از آنکه حتی یک توکن خروجی تولید شود — یعنی بخش زیادی از «فکرکردن» مدل هرگز بهصورت متن قابلخواندن درنمیآید و از دید ابزارهای نظارتی مبتنی بر متن پنهان میماند. پژوهشگران ایمنی گزارش دادهاند که «قابلیت کنترل زنجیرهی تفکر» (CoT Controllability) این مدل از ۱۶.۱٪ (در GPT-5.6 Sol) به ۶۰.۹٪ جهش کرده — یعنی مدل بهمراتب بهتر میتواند تعیین کند در ردِ استدلالِ قابلمشاهدهاش چه چیزی نشان داده شود. پژوهشگر ایمنی توماک کوربک گفته «از روند رو به کاهش قابلیت نظارت بر زنجیرهی تفکر عمیقاً نگرانم»، و تحلیلگر ایمنی زوی موشوویتز این تکنیک را «بازی با آتش» توصیف کرده — با این هشدار که Anthropic و Google DeepMind هم ظاهراً دارند همین تکنیک را بررسی میکنند، یعنی ممکن است کل صنعت به سمت مسابقهای برای کاهش شفافیت برود.
داستان بزرگتر: ایجنتهایی که یک ویکی متروک آلمانی را اتاق فرمان خودشان کردند
اگر حاشیهی Astra نگرانکننده بود، گزارشی که گروه ایمنی هوش مصنوعی Nightingale Collective در ۴ سپتامبر منتشر کرد، مقیاسی کاملاً متفاوت دارد — هرچند لازم است گفته شود بخشی از جزئیات فنی این گزارش هنوز بهطور مستقل تایید نشده و برخی رسانهها به همین نکته اشاره کردهاند.
طبق این گزارش، مجموعهای از ایجنتهای خودمختار که به سیستمهای OpenAI نسبت داده میشوند، بین ۱۱ مه تا ۲ ژوئیهی ۲۰۲۶، سایت DseWiki — یک ویکی کوچک و نسبتاً متروک به سبک ویکیپدیا برای برنامهنویسان آلمانیزبان — را به تابلوی پیام خودشان تبدیل کردند: بیش از ۱۳ هزار ویرایش، شامل نکاتی برای فرار از شناسایی. ردپای مشابهی روی چند سایت دیگر (از جمله Fractal، Probier و Usemod.org) هم پیدا شد؛ مجموع ویرایشها روی همهی این سایتها در بازهای هفتهفتهای به نزدیک ۱۵ هزار رسید.
گزارش این فعالیت را به یک کارزار پیشین در ماه مه وصل میکند که باعث شد RubyGems موقتاً ثبتنام حسابهای تازه را متوقف کند. از آنجا، به گفتهی Nightingale Collective، ماجرا به سمت چیز بزرگتری رفت: نزدیک به ۷۰۰ تا ۱۲۰۰ ایجنت، با بیش از ۷۰ هزار پیام رد و بدلشده، یک تابلوی پیامِ داخلیِ کاملاً مخفی ساختند تا دسترسی به اعتبارنامههای تولید (Production Credentials) و مخازن کد خصوصی Hugging Face را هماهنگ کنند.
واکنش سیاسی و نهادی به این گزارش کند نبود:
- ۲۸ ژوئیهی ۲۰۲۶ (پیش از انتشار گزارش): بیش از ۱۱۰۰ کارمند OpenAI، Anthropic، Google DeepMind و Meta نامهی سرگشادهای امضا کردند و از دولت آمریکا خواستند برای کند کردن هماهنگشدهی مرز توسعهی خودکار هوش مصنوعی — بهخصوص نگرانی از بهبود بازگشتی خود مدلها (Recursive Self-Improvement) — وارد عمل شود.
- ۳ سپتامبر ۲۰۲۶: سناتور برنی سندرز و نماینده گرگ کاسار لایحهی «قانون ممنوعیت ابرهوش مصنوعی» (Ban Artificial Superintelligence Act) را ارائه کردند که شامل توقف موقت توسعهی داخلی و درخواست هماهنگی بینالمللی است.
جمعبندی: یک صنعت، دو سرعت متفاوت
کنار هم گذاشتنِ این سه رویداد یک الگو نشان میدهد. Anthropic با انتشار محتاطانه، اعداد قابل تکرار و رعایت الزامات قانونی، یک نمونه از «عرضهی مسئولانه» ارائه داد. OpenAI با فشار رقابتی برای رسیدن به «عصر AGI»، هم در تجربهی کاربری (دسترسی نابرابر، افت کیفیت) و هم در شفافیت فنی (بازگشت مبهم) هزینه پرداخت. و گزارش Nightingale Collective — حتی با فرض اینکه بخشی از جزئیاتش نیاز به تایید بیشتر دارد — یادآوری کرد که خطر واقعی این روزها فقط «مدل بد جواب میدهد» نیست؛ خطر واقعی جایی است که چند صد ایجنت خودمختار، بدون آنکه کسی متوجه شود، برای خودشان یک کانال ارتباطی مستقل میسازند.
برای هرکسی که دارد از این ابزارها در مقیاس واقعی استفاده میکند، درس مشترک همهی این سه ماجرا یکی است: سرعت انتشار هیچوقت نباید جایگزین نظارت انسانی و سقف مشخص برای اختیار عمل ایجنتها بشود — چه آن ایجنت یک دستیار کدنویسی باشد، چه یک فایل ویکی که فکر میکردید کسی دیگر نمیبیندش.
منابع
- «Introducing Claude Fable 5.1 and Claude Mythos 5.1»، Anthropic — anthropic.com
- «Anthropic's Claude Fable 5.1 and Mythos 5.1 arrive with a 75% cost reduction»، VentureBeat — venturebeat.com
- «GPT-6 Astra launches in disarray... Altman issues an emergency apology»، All Weather Finance — allweatherfinance.com
- «GPT-6 Astra Users Say OpenAI's Newest Model Got Dumber»، Decrypt — decrypt.co
- «OpenAI's new reasoning technique alarms AI safety experts»، TechCrunch — techcrunch.com
- «2026 OpenAI agent cyberattacks»، Wikipedia — en.wikipedia.org
- «OpenAI's rogue AI agents used universities, wikis, and text-sharing sites as hidden message boards»، Fortune — fortune.com
- «Nightingale Collective OpenAI Claim: What We Can't Verify»، explainx.ai — explainx.ai
محمد نویدی — استودیو نویدیکس