Cohere Labs پژوهشی منتشر کرده که هدف آن واداشتن مدلهای reasoning به انجام مراحل میانی استدلال به همان زبانی است که کاربر استفاده میکند، نه اینکه مدل تقریباً همیشه درون خود به انگلیسی فکر کند. در این کار Tiny Aya L2-Thinker، یک مدل پژوهشی ۳.۳۵ میلیارد پارامتری، معرفی شده و پژوهشگران استدلال میکنند که ترکیب دقیق دادههای supervised fine-tuning میتواند این رفتار را بدون نیاز به مجموعه بزرگ داده reasoning برای هر زبان منتقل کند.
روش آموزش از سه نوع داده استفاده میکند. دادههای reasoning انگلیسی پایه عمومی حل مسئله را ایجاد میکنند. مقدار بسیار کمتری از داده reasoning چندزبانه به مدل یاد میدهد مراحل استدلال را در زبانهای دیگر بیان کند. در مرحله سوم، دادههای پرسش و پاسخ چندزبانه که زنجیره استدلال ندارند به تعمیم این رفتار کمک میکنند، حتی برای زبانهایی که نمونه reasoning اختصاصی در آموزش نداشتهاند.
مدل روی شش benchmark و ۶۰ زبان در حوزههایی مانند ریاضیات، استدلال فرهنگی و عقل سلیم، پیروی از دستور و تولید متن آزاد ارزیابی شده است. Cohere گزارش میکند که Tiny Aya L2-Thinker در بیش از ۹۳ درصد موارد به زبان پرامپت reasoning انجام میدهد و در بیشتر ارزیابیها دقتی نزدیک به مدل همتایی دارد که به انگلیسی استدلال میکند. با این حال در PolyMath، که benchmark دشوارتری برای ریاضیات رقابتی است، افت دقت محسوستر گزارش شده است.
پژوهش همچنین روشهای زمان inference را بررسی میکند. طبق نتایج تیم، صرفاً درخواست از Qwen3.5-4B برای reasoning به زبان هدف تغییر زیادی ایجاد نمیکند. اجبار شروع زنجیره استدلال به زبان هدف میزان تبعیت را بهتر میکند، اما با کاهش دقت همراه است. پژوهشگران همچنین میگویند Tiny Aya L2-Thinker در چند مقایسه از توکنهای reasoning کمتری استفاده کرده و کمتر وارد چرخههای تکراری شده است.
اهمیت این پژوهش در این است که ارزیابی چندزبانه معمولاً فقط زبان پاسخ نهایی را میسنجد. ممکن است مدل پاسخ فارسی تولید کند، اما مراحل استدلال را همچنان به انگلیسی انجام دهد. Cohere وزنهای مدل و دادههای چندزبانه را منتشر کرده و امکان بررسی و بازتولید آینده را افزایش داده است. با این حال در این بررسی، بازتولید مستقل معتبری برای عدد ۹۳ درصد پیدا نشد و بنابراین ارقام عملکرد باید همچنان به تیم پژوهشی Cohere نسبت داده شوند.