یک پژوهش پیش‌ثبت‌شده که ۳ سپتامبر منتشر شد، پرسشی عملی را پیش روی تیم‌هایی می‌گذارد که از مدل‌های زبانی برای ارزیابی خروجی استفاده می‌کنند: آیا خودِ ارزیاب آن‌قدر پایدار هست که بتوان تصمیم انتشار یا رد را به آن سپرد؟

مقاله Clean Engineering, Unstable Measurement با هدف حمله به روش ارزیابی با مدل زبانی نوشته نشده است. پژوهشگران می‌خواستند میزان پیشرفت حل مسئله را از روی بخش‌های قابل مشاهده مسیر استدلال بسنجند. اما در طرح از پیش ثبت‌شده، مدل ارزیاب باید قبل از هر نتیجه علمی از چند آزمون پایداری عبور می‌کرد. هر دو مرحله پژوهش همان‌جا متوقف شدند.

نویسندگان در مجموع ۵۲٬۹۸۸ تلاش برای ارسال درخواست را ثبت کرده‌اند. در آزمون تکرار در یک بازه زمانی، همبستگی رتبه‌ای اسپیرمن به ۰٫۴۰۰ رسید، در حالی که حد از پیش تعیین‌شده ۰٫۹۰ بود. در آزمایشی جداگانه، ۱۰۰ درخواست کاملاً یکسان در روز بعد دوباره به همان نام مدل ارسال شد و تطابق کامل رتبه‌بندی ۰٫۷۸ بود؛ معیار قبولی ۰٫۹۹ تعیین شده بود.

عدد ۵۲٬۹۸۸ به معنای ۵۲٬۹۸۸ نمونه مستقل نیست. خود مقاله تأکید می‌کند که تحلیل‌ها بر واحدهای کوچک‌تری مانند ۳۱ گروه معتبر مسئله، ۱۰۰ جفت بازپخش و ۳٬۰۶۰ داوری روی خطاهای ساختگی استوارند. بنابراین موضوع، «برد یا باخت در یک ارزیابی مقایسه‌ای بزرگ» نیست؛ بحث بر سر قابلیت اعتماد یک ابزار اندازه‌گیری است.

اجرای بی‌نقص درخواست، پایداری اندازه‌گیری را تضمین نمی‌کند

بخش مهم پژوهش تفکیک دو چیز است: صحت اجرای سامانه و قابلیت اعتماد اندازه‌گیری. ممکن است ارسال درخواست، ساختار پاسخ، هش درخواست و فراداده ثبت‌شده همگی درست باشند، اما ارزیاب همچنان نتواند از آزمون پایداری عبور کند.

نویسندگان سه سازوکار را بررسی کرده‌اند. در یک روش، نگاشت برچسب‌ها به معنا روی نتیجه اثر می‌گذاشت. در روش دیگر، فاصله واقعی میان گزینه‌ها بسیار کوچک‌تر از نوسان خود ابزار بود. در رتبه‌بندی کامل نیز درخواست‌های بایت‌به‌بایت یکسان گاهی ترتیب‌های متفاوتی تولید می‌کردند و الزام به تطابق دقیق کل ترتیب، تغییرهای کوچک را به شکست کامل تبدیل می‌کرد.

اصل فنی این مسئله با شواهد مستقل هم سازگار است. Thinking Machines Lab پیش‌تر نشان داده بود که حتی در دمای صفر، دسته‌بندی هم‌زمان درخواست‌ها می‌تواند خروجی استنتاج را تغییر دهد و برای رفع آن کرنل‌های مستقل از اندازه دسته منتشر کرد. مستندات vLLM Ascend نیز اکنون حالت «استقلال از دسته» را برای تولید خروجی مستقل از اندازه و ترتیب درخواست‌ها توضیح می‌دهد.

Anthropic هم در مستندات نسخه‌بندی مدل‌هایش مرز مهمی را روشن کرده است: شناسه مدل می‌تواند وزن‌ها را ثابت نگه دارد، اما زیرساخت سرویس‌دهی پیرامون مدل، مانند مسیریابی یا منطق نمونه‌گیری، ممکن است تغییر کند و تفاوت رفتاری ایجاد کند.

این منابع، اعداد همین مقاله را به‌طور مستقل بازتولید نمی‌کنند. فقط نشان می‌دهند فرض فنی مقاله، یعنی یکی نبودن «نام ثابت مدل» با «ابزار اندازه‌گیری کاملاً ثابت»، از نظر مهندسی معقول است.

افزایش تعداد درخواست‌ها راه‌حل جادویی نبود

پژوهش فقط یک درخواست ناپایدار را تکرار نکرد. در آزمایش‌های تکمیلی، چهار ارائه‌دهنده روی مجموعه آزمون مورد استفاده، میانه پایداری بازپخش بین ۰٫۷۴ تا ۰٫۸۸ داشتند. صبر کردن در روزهای بررسی‌شده بهبود معناداری ایجاد نکرد. اجرای خودمیزبان با کرنل‌های مستقل از دسته در حالت کم‌بار بهتر بود، اما با افزایش هم‌زمانی، میزان اختلاف ۸٫۴ برابر شد و دوباره به محدوده سرویس‌های اشتراکی نزدیک شد.

نویسندگان حتی طرحی بسیار بزرگ‌تر را شبیه‌سازی کردند. در توزیع اندازه‌گیری‌شده، طرحی معادل ۷۴۸ هزار فراخوان در ۵۰۰ شبیه‌سازی حتی یک بار هم از معیار از پیش تعیین‌شده عبور نکرد. نتیجه این نیست که افزایش نمونه هیچ‌وقت مفید نیست. نکته این است که اگر فاصله‌ای که می‌خواهیم تشخیص دهیم از توان تفکیک ابزار کوچک‌تر باشد، صرفاً بیشتر کردن تعداد درخواست مشکل بنیادی را حل نمی‌کند.

دامنه ادعا نیز محدود شده است. مقاله نمی‌گوید همه ارزیاب‌های مبتنی بر مدل زبانی غیرقابل استفاده‌اند یا همه ارائه‌دهندگان رفتار یکسان دارند. نتیجه فقط به مدل‌ها، روش رتبه‌بندی، درخواست‌ها و بازه‌های زمانی آزمایش‌شده مربوط است.

بسته بازتولید عمومی شامل مانیفست‌ها، داده‌های مشتق‌شده، گزارش‌ها، تنظیمات ثابت‌شده، اسناد پیش‌ثبت و کد ساخت نمودارهاست؛ پاسخ خام ارائه‌دهندگان عمومی نشده و فقط با درخواست و بررسی شرایط دسترسی قابل دریافت است. مقاله همچنین یک انحراف زمانی در پیش‌ثبت و یک شکاف منشأ برای بخشی از اجراهای قدیمی‌تر را صریح اعلام کرده و آن بخش‌ها را تنها در حد شواهد اکتشافی نگه داشته است.

پیش از سپردن اختیار رد یا پذیرش، قابلیت اعتماد ارزیاب را بسنجید

جمع‌بندی Aipolix این نیست که استفاده از مدل زبانی برای ارزیابی متوقف شود. مسئله این است که نباید اجازه داد یک ارزیاب درباره انتشار، پذیرش داده آموزشی یا عبور از آزمون پسرفت تصمیم قطعی بگیرد، مگر اینکه قابلیت اعتماد خودش در همان مسیر عملیاتی اندازه‌گیری شده باشد.

برای سامانه‌های تولیدی، چهار کنترل منطقی است.

نخست، دقیق‌ترین شناسه ممکن از نسخه مدل و شرایط سرویس ثبت شود، نه فقط نام دوستانه مدل. اگر API شناسه تاریخ‌دار، اثرانگشت یا فراداده نسخه ارائه می‌دهد، باید همراه هر اجرای ارزیابی ذخیره شود.

دوم، پیش از تعیین آستانه، تکرارپذیری همان ورودی سنجیده شود. بخشی نماینده از داده‌ها باید در همان بازه و نیز در فاصله زمانی مرتبط با تصمیم عملیاتی دوباره اجرا شود. پرسش اصلی این است که نوسان طبیعی ارزیاب در مقایسه با فاصله تصمیم چقدر است.

سوم، آستانه باید با دقت واقعی ابزار سازگار باشد. اگر انتشار محصول با تغییر یک امتیاز متوقف می‌شود اما ارزیاب روی ورودی یکسان چند امتیاز جابه‌جا می‌شود، آن معیار هم محصول را اندازه می‌گیرد و هم نوسان ابزار را. در این وضعیت باید آستانه، روش تجمیع یا خود ارزیاب تغییر کند.

چهارم، خرابی در سنجش باید به «اندازه‌گیری نامعتبر» منجر شود، نه اینکه بی‌صدا به قبولی یا رد محصول تبدیل شود. پاسخ خراب، نبود شناسه نسخه یا رد شدن آزمون پایداری باید اختیار تصمیم را از ارزیاب بگیرد.

پیام مهم برای حاکمیت هوش مصنوعی

در بسیاری از طرح‌های حاکمیتی، مدل ارزیاب به‌عنوان یک کنترل کم‌هزینه در نظر گرفته می‌شود: خروجی را بررسی کن، امتیاز را با سیاست مقایسه کن و مرحله بعد را مجاز یا مسدود کن. این پژوهش نشان می‌دهد چنین کنترلی ممکن است از ظاهرش ضعیف‌تر باشد، حتی وقتی کل اتوماسیون اطراف آن دقیق و قابل حسابرسی است.

سوابق ثبت‌شده کامل می‌توانند ثابت کنند سامانه دقیقاً طبق طراحی اجرا شده است، اما اگر ابزار اندازه‌گیری در مقیاس مرز تصمیم ناپایدار باشد، همان سوابق هنوز ثابت نمی‌کنند که تصمیم قابل بازتولید بوده است.

این تفاوت باید وارد طراحی تولید شود: شواهد اجرا نشان می‌دهند سامانه چه کاری انجام داده؛ شواهد مربوط به ابزار نشان می‌دهند آیا آن اندازه‌گیری اصلاً صلاحیت تصمیم‌گیری داشته است یا نه.

مهم‌ترین ارزش این مقاله یک امتیاز تازه در یک ارزیابی مقایسه‌ای نیست. پیام آن برای زیرساخت ارزیابی روشن است: پیش از آنکه یک مدل زبانی به مرجع عبور یا توقف تبدیل شود، باید در همان شرایط سرویس‌دهی که قرار است تصمیم بگیرد، به‌عنوان ابزار اندازه‌گیری ارزیابی شود.

منابع
- https://arxiv.org/abs/2609.04198
- https://arxiv.org/html/2609.04198v1
- https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/
- https://platform.claude.com/docs/en/about-claude/models/model-ids-and-versions
- https://docs.vllm.ai/projects/ascend/en/main/user_guide/feature_guide/batch_invariance.html