UiPath در نسخه پیش‌نمایش قابلیت تازه‌ای برای کنترل عامل‌ها عرضه کرده است که در آن یک مدل زبانی نقش داور را دارد. تیم‌ها می‌توانند قاعده را با زبان طبیعی بنویسند و از مدل بخواهند ورودی، پاسخ یا فراخوانی‌های مدل در جریان کار عامل را با آن قاعده بسنجد. نکته مهم این است که هر بار این کنترل اجرا می‌شود، یک فراخوانی جداگانه به مدل انجام می‌گیرد و طبق توضیح UiPath مصرف آن جدا از مصرف معمول عامل محاسبه می‌شود.

در نتیجه، این کنترل فقط به متن یک قاعده وابسته نیست. انتخاب مدل داور، آستانه تصمیم، مثال‌های راهنما، محل اجرای بررسی و فعال یا غیرفعال بودن آن در ارزیابی، همگی روی نتیجه اثر می‌گذارند. برای تیمی که می‌خواهد رفتار عامل را قابل ممیزی نگه دارد، این تنظیمات عملاً بخشی از خود سیاست اجرایی هستند.

مدل داور داخل مسیر کنترل اجرا می‌شود

در یادداشت انتشار سپتامبر، UiPath این قابلیت را یک کنترل داخلی معرفی کرده که می‌تواند رفتار عامل را با دستورهایی که تیم به زبان طبیعی تعریف می‌کند بررسی کند. در SDK پایتون نیز همین سازوکار با نام LLMAsJudgeValidator در دسترس است و می‌توان آن را پیش از اجرا، پس از اجرا یا در هر دو مرحله به کار گرفت.

مستندات SDK اجازه می‌دهد مدل داور، متن قاعده تا سقف ۴۰۰۰ نویسه، آستانه‌ای از صفر تا شش و حداکثر دو نمونه مثبت و دو نمونه منفی تعیین شود. آستانه پایین‌تر سخت‌گیرانه‌تر است و مقدار پیش‌فرض دو در نظر گرفته شده است. مدل انتخاب‌شده نیز باید طبق سیاست‌های سازمان در LLM Gateway مجاز باشد.

بنابراین تصمیم این کنترل فقط حاصل تطبیق یک عبارت ثابت نیست. مدل باید قاعده را تفسیر کند و نتیجه به ترکیب مدل، آستانه و مثال‌ها وابسته است.

برای ممیزی، ثبت متن قاعده کافی نیست

اگر سازمان فقط متن قاعده را نگه دارد، بعداً لزوماً نمی‌تواند بازسازی کند که چرا یک درخواست مجاز یا مسدود شده است. برای بازسازی تصمیم باید دست‌کم مدل داور و نسخه یا شناسه استقرار آن، آستانه، مثال‌ها، مرحله اجرا و اقدامی که پس از تشخیص انجام شده ثبت شود.

پیامد عملی این موضوع روشن است: دو محیط می‌توانند دقیقاً یک متن سیاست داشته باشند اما با مدل یا آستانه متفاوت، رفتار یکسانی نشان ندهند. پس تغییر مدل داور باید مانند تغییر خود قاعده مدیریت شود؛ با نسخه‌بندی، تأیید تغییر، آزمون بازگشتی و امکان ردیابی.

UiPath همچنین گفته است که این قابلیت هنوز در مرحله پیش‌نمایش است و عرضه آن برای همه محیط‌های مشتریان هم‌زمان انجام نشده است. بنابراین رفتار و دسترس‌پذیری فعلی را نباید معادل یک قرارداد پایدار تولیدی دانست.

هزینه کنترل به محل استفاده از آن بستگی دارد

UiPath صریحاً می‌گوید هر بررسی با مدل داور یک فراخوانی واقعی به مدل ایجاد می‌کند و مصرف جداگانه دارد. مستندات مجوزدهی عامل‌های کدنویسی‌شده نیز نشان می‌دهد فراخوانی مدل بسته به نوع قرارداد با Agent Unit یا Platform Unit محاسبه می‌شود.

به همین دلیل محل قرار دادن این کنترل اهمیت اقتصادی و عملیاتی دارد. بررسی فقط پس از یک عملیات پرخطر با اجرای همان کنترل پیش و پس از هر تعامل مدل، هزینه یکسانی ندارد. اگر چند قاعده داوری در چند مرحله فعال شوند، تعداد فراخوانی‌های مدل می‌تواند بدون تغییر در منطق اصلی عامل چند برابر شود.

برای طراحی درست باید مشخص شود کدام تصمیم واقعاً به داوری احتمالاتی نیاز دارد، کجا یک کنترل قطعی کافی است و در چه نقاطی هزینه و تأخیر یک فراخوانی دیگر قابل قبول است.

ارزیابی عامل و ارزیابی سامانه کنترل‌شده یکی نیستند

در SDK گزینه enabled_for_evals وجود دارد و به‌طور پیش‌فرض فعال است. این انتخاب برای سنجش سامانه‌ای که قرار است با کنترل‌ها وارد تولید شود مفید است، اما باید روشن باشد چه چیزی اندازه‌گیری می‌شود.

وقتی مدل داور هنگام آزمون فعال است و بعضی رفتارها را مسدود یا ثبت می‌کند، نتیجه مربوط به ترکیب عامل و لایه کنترل است، نه فقط خود عامل. این همان چیزی است که در یک آزمون آمادگی تولید ممکن است لازم باشد، اما با سنجش رفتار پایه عامل تفاوت دارد.

تحلیل Aipolix این است که برای ارزیابی‌های قابل تکرار، در موارد مهم باید هر دو تصویر حفظ شود: یک خط مبنا برای رفتار عامل بدون داور و یک ارزیابی از سامانه نهایی با دقیقاً همان تنظیمات داوری که در محیط عملیاتی استفاده می‌شود. در غیر این صورت ممکن است بهبود نرخ ایمنی یا انطباق به اشتباه به خود عامل نسبت داده شود، در حالی که عامل تغییری نکرده و این لایه کنترل بوده که نتیجه را تغییر داده است.

پیش‌نمایش بودن، دامنه ادعا را محدود می‌کند

UiPath یک قابلیت واقعی با تنظیمات مشخص عرضه کرده است، اما هنوز آن را پیش‌نمایش می‌نامد. مستندات موجود نحوه پیکربندی، محل اجرا و شیوه محاسبه مصرف را روشن می‌کنند، ولی از این شواهد نمی‌توان نتیجه گرفت که مدل داور در همه حوزه‌ها یا در برابر ورودی‌های خصمانه با دقت ثابت سیاست‌ها را اجرا می‌کند.

برای تیم‌هایی که می‌خواهند این قابلیت را آزمایش کنند، نتیجه عملی فعلاً این است: مدل داور را بخشی نسخه‌بندی‌شده و قابل‌محاسبه از مسیر کنترل در زمان اجرا در نظر بگیرید. مدل و تنظیمات آن را کنار متن سیاست ثبت کنید، خطاهای این لایه را جدا از رفتار پایه عامل بسنجید و هزینه فراخوانی‌های کنترلی را در بودجه استنتاج عامل حساب کنید.

Sources
- یادداشت انتشار UiPath Agents در سپتامبر ۲۰۲۶
- مستندات کنترل‌ها در SDK پایتون UiPath
- مستندات مجوزدهی و مصرف عامل‌های UiPath