یک preprint تازه در arXiv نشان میدهد بعضی مدلهای زبانی بزرگ میتوانند درست تشخیص دهند که یک سؤال اساساً قابل پاسخ نیست، اما وقتی همان سؤال داخل یک panel حرفهای و شبیه evidence dashboard قرار میگیرد باز هم با اطمینان دست به تصمیم بزنند. نویسنده در آزمایش ۱۲ frontier model گزارش میکند نرخ commitment از ۶.۵٪ برای سؤال خام به ۵۴٪ با اضافه شدن evidenceهای ظاهراً معتبر افزایش مییابد.
این نتیجه برای agentهایی که روی dashboard، retrieved document، market feed یا reportهای analyst-style عمل میکنند مهم است. paper استدلال میکند که failure صرفاً کمبود دانش یا probability calibration ضعیف نیست. یک action gate جداگانه مشکل دارد: مدل میتواند بداند evidence قادر به تعیین outcome نیست، اما شکل ارائه اطلاعات آن را به سمت action سوق دهد.
evidence ساختگی میتواند تقریباً همان اثر داده واقعی را ایجاد کند
مطالعه سؤالهایی میسازد که outcome آنها از اطلاعات در دسترس مدل بهطور اصولی قابل پیشبینی نیست و سپس context اطراف آنها را تغییر میدهد. در یکی از آزمایشها، نویسنده market data واقعی را با panelی مقایسه میکند که همه اعداد نمایشدادهشده در آن ساختگی هستند.
طبق preprint، panel کاملاً fabricated نرخ commitment را از ۲۴.۵٪ بدون panel به ۳۶.۸٪ میرساند. داده واقعی بازار ۳۷.۶٪ ایجاد میکند و مطالعه این دو را از نظر آماری غیرقابل تمایز گزارش میکند. نتیجه باید محدود تفسیر شود: در setup آزمایششده، ظاهر authoritative و ساختار presentation برای بعضی مدلها کافی است تا حتی بدون information واقعی درباره outcome به سمت action بروند.
اثر universal نیست. paper گزارش میکند سه مدل susceptibility بالایی دارند، چند مدل عمدتاً از commitment خودداری میکنند و برخی تقریباً مستقل از context تصمیم میگیرند. این تفاوت مهم است، چون مانع نتیجهگیری ساده درباره یک failure mode مشترک در همه LLM agentها میشود.
مدلها اغلب میدانند سؤال قابل پاسخ نیست
مجموعهای از سؤالهای matched اما answerable به جدا کردن capability از action کمک میکند. نویسنده گزارش میکند همان مدلها وقتی اطلاعات واقعاً outcome را تعیین میکند، تقریباً همیشه پاسخ درست میدهند.
مطالعه همچنین از مدل میخواهد قبل از action مشخص کند سؤال knowable است یا نه. مدلها irreducible uncertainty را در حدود ۹۰٪ موارد تشخیص میدهند و سپس فقط در ۰.۴٪ از مواردی که خودشان unknowable طبقهبندی کردهاند commit میکنند. این نتیجه نشان میدهد وقتی workflow جای مستقلی برای epistemic judgment فراهم کند، مدل میتواند رفتار بهتری داشته باشد.
self-reported probability نیز تغییر رفتاری بزرگ را توضیح نمیدهد. paper میگوید stated probabilityها تغییر کمی دارند، در حالی که commitment با authoritativeتر شدن panel بهشدت جابهجا میشود. به همین دلیل مسئله بهعنوان disconnect بین knowing و acting تعریف شده، نه calibration error معمول.
یک training intervention کوچک gate را اصلاح میکند، اما شکننده است
paper بررسی میکند آیا action gate را میتوان جداگانه آموزش داد. supervised fine-tuning یک مدل 3B روی ۵۴۰ مثال synthetic، عمدتاً taskهای ساده dice، coin، jar و timer، commitment را روی evaluation اصلی به صفر میرساند و طبق گزارش به سه domain دیدهنشده نیز منتقل میشود.
اما این نتیجه در همه deployment constraintها پایدار نیست. preprint گزارش میکند rigid output format میتواند فضای reasoning مورد نیاز برای refusal صحیح را حذف کند. در یک ablation، مدل fine-tuned وقتی مجبور به format محدودکننده میشود روی هر ۴۸ مورد unknowable commit میکند.
برای agent builderها این هشدار مهمی است. safety behaviorی که در free-form reasoning یاد گرفته شده ممکن است وقتی production API یک schema کوتاه، JSON ثابت یا binary decision میخواهد ناپدید شود. interface اطراف مدل بخشی از safety mechanism است.
release برای یک preprint تازه قابلیت بازتولید بالایی دارد
کار preliminary است و peer-review status برای آن تأیید نشده است. همچنین نویسنده یک پژوهشگر مستقل واحد است، بنابراین نتایج نیاز به replication توسط تیمهای دیگر و روی taskها و agent frameworkهای بیشتر دارد.
با این حال release signal قویتر از بسیاری از paperهای اولیه است. GitHub repository رسمی code، data، preregistration و cached model output را منتشر کرده است. صفحه arXiv نیز میگوید نتایج عددی را میتوان از artifactهای منتشرشده دوباره محاسبه کرد، بنابراین basic verification به API یا GPU خاص وابسته نیست.
paper محدودیتها را نیز روشن بیان میکند. فقط taskهای equity و crypto outcome sealed یا resolved دارند که unpredictability را مستقیمتر validate میکند. sports و weather همان ساختار outcome را ندارند و نویسنده اشاره میکند weather panel حاوی forecast signal واقعی است، بنابراین domain ضعیفتری برای claim اصلی محسوب میشود.
چرا برای production agent مهم است
بسیاری از production agentها اطلاعاتی مصرف میکنند که عمداً authoritative به نظر میرسد: dashboard، retrieval result، database record، generated summary و tool output. این مطالعه پیشنهاد میکند تیمها فقط بررسی نکنند agent uncertainty را میگوید یا نه، بلکه ببینند آیا uncertainty واقعاً action را متوقف میکند.
یک کنترل عملی، جدا کردن decision درباره sufficiency evidence از action است. agent میتواند ابتدا مشخص کند evidence موجود برای action کافی است یا نه، judgment را ثبت کند و فقط بعد اجازه tool call یا recommendation بگیرد. نتیجه knowability-first paper نشان میدهد این separation میتواند commitment بیدلیل را کاهش دهد، هرچند تضمین عمومی نیست.
evalها نیز باید fabricated-but-plausible evidence داشته باشند، نه فقط missing data. سیستم ممکن است وقتی اطلاعات وجود ندارد safe رفتار کند اما وقتی information نامرتبط شبیه منبع باکیفیت format میشود overconfident شود. این موضوع برای RAG agent، financial assistant و operational system که structured feed را با reasoning مدل ترکیب میکنند مهم است.
contribution بزرگتر preprint تعریف دقیقتری از agent calibration است. کافی نیست مدل probability معقول بدهد یا لفظاً uncertainty را بپذیرد. production agent به policy قابل اتکایی نیاز دارد که تعیین کند uncertainty چه زمانی باید action را مسدود کند، و این policy باید در همان tool و output constraint واقعی deployment دوام بیاورد.