Cohere مدل North Small Translate را برای ترجمه ماشینی منتشر کرده است؛ مدلی با معماری MoE که فایلهای آن را میتوان دریافت کرد و خارج از سرویس میزبانیشده Cohere اجرا کرد. این مدل در مجموع ۲۱۸ میلیارد پارامتر دارد، در هر گام ۲۵ میلیارد پارامتر را فعال میکند، از ۵۰ زبان پشتیبانی میکند و برای ورودی و خروجی تا 16K توکن ظرفیت دارد. نسخههای BF16، FP8 و NVFP4 W4A16 نیز منتشر شدهاند.
اما یک محدودیت مهم در مجوز وجود دارد. فایلهای عمومی مدل تحت CC BY-NC 4.0 و شرایط استفاده Cohere Labs عرضه شدهاند؛ یعنی برای پژوهش، ارزیابی و استفاده غیرتجاری در دسترساند، نه برای هر نوع استفاده تجاری. Cohere برای کاربرد تجاری مجوز جداگانه و Model Vault را پیشنهاد میکند.
انتشار فایلهای مدل به معنی آزادی استفاده تجاری نیست
اصطلاح «وزنهای قابلدریافت» (open weights) بیشتر درباره امکان دسترسی فنی به مدل صحبت میکند و لزوماً حقوق استفاده نامحدود نمیدهد. North Small Translate نمونه روشنی از همین تفاوت است. پژوهشگر یا تیم فنی میتواند پس از پذیرش شرایط مخزن، مدل را از Hugging Face دریافت کند، کارت مدل را بررسی کند و آن را روی زیرساخت خودش اجرا کند. در عین حال، اسناد Cohere صریحاً میگویند مجوز عمومی برای استفاده غیرتجاری است.
برای تیمهای معماری و خرید سازمانی، این موضوع به اندازه کیفیت مدل اهمیت دارد. وجود فایل مدل بهخودیخود به این معنا نیست که یک شرکت حق دارد آن را در محصول درآمدزا قرار دهد، نسخهای مشتقشده را توزیع کند یا بار کاری تجاری را تحت همان مجوز عمومی اجرا کند. دامنه این حقوق باید با قرارداد تجاری جداگانه بررسی شود.
از نگاه Aipolix، «حاکمیت» در اینجا دو بخش مستقل دارد: کنترل فنی بر محل اجرای مدل و حق قانونی استفاده از آن. میزبانی روی زیرساخت خود سازمان میتواند کنترل داده و عملیات را بیشتر کند، اما محدودیت مجوز را از بین نمیبرد.
۲۵ میلیارد پارامتر فعال هنوز به سختافزار جدی نیاز دارد
North Small Translate یک مدل تنک با معماری MoE است. در مجموع ۲۱۸ میلیارد پارامتر دارد و در هر توکن ۲۵ میلیارد پارامتر فعال میشوند. کارت مدل از ۱۲۸ خبره صحبت میکند که هشت مورد از آنها برای هر توکن انتخاب میشوند و در کنار آنها خبرههای مشترک نیز وجود دارند.
عدد ۲۵ میلیارد ممکن است مدل را کوچکتر از واقعیت عملی آن نشان دهد. Cohere برای نسخه BF16 حداقل هشت H100 یا چهار B200، برای FP8 چهار H100 یا دو B200 و برای نسخه NVFP4 W4A16 دو H100 یا یک B200 را پیشنهاد میکند. در کارت نسخه کمدقتتر نیز آمده است که کمدقتسازی حجم مدل را از حدود ۴۳۷ گیگابایت به ۱۳۱ گیگابایت کاهش میدهد.
بنابراین مدل برای سازمانی که به شتابدهندههای جدید دسترسی دارد قابل میزبانی است، اما در رده مدلهای سبک برای سختافزار معمول توسعهدهندگان قرار نمیگیرد. مقایسه با سرویسهای ترجمه ابری باید هزینه GPU، میزان بهرهبرداری، همزمانی درخواستها و نگهداری زیرساخت را هم در نظر بگیرد.
برتری بنچمارکی هنوز ادعای خود سازنده است
Cohere برای ارزیابی چندزبانه WMT26 امتیاز ۸۳٫۶۰ را گزارش کرده و میگوید روش چندمرحلهای که Cohere آن را Agentic مینامد و ترجمه را دوباره بررسی و اصلاح میکند به امتیاز ۸۴٫۳۶ میرسد. در مطلب معرفی، این نتایج با DeepL، Google Translate و چند مدل دارای وزن قابلدریافت مقایسه شدهاند. شرکت همچنین از توان عملیاتی بالاتر نسبت به Gemma 4 31B در آزمون داخلی و نتیجه بهتر در ترجمه متنهای بلند خبر میدهد.
این اعداد برای تصمیم به آزمایش مدل مفیدند، اما تأیید مستقل محسوب نمیشوند. Cohere میگوید در مقایسه WMT26 از GPT-5.6-Sol بهعنوان داور استفاده کرده و برای ارزیابی متن بلند از xCOMET-XL بهره گرفته است. در اسناد عرضه، ارزیابی انسانی مستقلی که کیفیت همه زبانهای پشتیبانیشده را پوشش دهد ارائه نشده است.
در ترجمه، میانگین خوب میتواند اختلافهای بزرگ میان زبانها، حوزههای تخصصی و انواع سند را پنهان کند. مدلی که در میانگین قوی است ممکن است در متن حقوقی، اصطلاحات محصول، نامهای خاص، قالببندی یا یک زبان کممنبع برای کاربرد مشخص یک سازمان ضعف داشته باشد.
بنابراین جدول Cohere باید نقطه شروع ارزیابی باشد، نه نتیجه نهایی خرید. ارزیابی تولیدی بهتر است برای جفتزبانها و اسناد واقعی سازمان، بازبینی انسانی دوزبانه داشته باشد.
روش چندمرحلهای واحد واقعی هزینه را تغییر میدهد
امتیاز بالاتر حالت Agentic از این جهت مهم است که دیگر فقط یک اجرای ساده مدل را اندازه نمیگیرد. Cohere آن را فرایندی معرفی میکند که خطاهای ترجمه را پیدا و اصلاح میکند.
مطلب عرضه امتیاز کیفی این روش را اعلام میکند، اما مقایسه همسطحی از زمان انتها تا انتها و هزینه حالت Agentic در برابر مدل استاندارد ارائه نمیدهد. تیمهای فنی باید کل فرایند را بسنجند: چند مرحله اجرا میشود، تولید اضافه چقدر است، تأخیر چه تغییری میکند و آیا بهبود گزارششده در بازبینی انسانی هم باقی میماند.
این تفاوت برای مقایسه بنچمارکها مهم است. وقتی یک فرایند چندمرحلهای ترجمه را بازبینی و اصلاح میکند، نتیجه فقط توان مدل پایه نیست؛ کیفیت یک سامانه کامل است. اگر کیفیت آن بهتر باشد، هزینه و الگوی خطای همان سامانه نیز باید همزمان سنجیده شود.
پشتیبانی از فارسی و پرتغالی تضمین کیفیت یکسان نیست
کارت مدل ۵۰ زبان را فهرست میکند که فارسی، پرتغالی و فرانسوی نیز در میان آنها هستند. این پوشش برای محصولاتی که میخواهند ترجمه را روی زیرساخت تحت کنترل خود نگه دارند جذاب است.
اما حضور یک زبان در فهرست پشتیبانی به معنی برابری کیفیت در همه جفتزبانها نیست. Cohere میانگینهای منطقهای و نتایج کلی منتشر کرده، نه یک گزارش مستقل انسانی برای تکتک مسیرهای ترجمه. برای محصولی که کاربران فارسی یا پرتغالی اروپایی دارد، معیار پذیرش باید متن واقعی باشد: اصطلاحات، لحن، نشانهگذاری، نمایش راستبهچپ در فارسی و حفظ ساختار سند باید توسط ویراستار بومی بررسی شوند.
ظرفیت 16K نیز امکان ترجمه واحدهای بزرگتر را فراهم میکند، اما هماهنگی اصطلاحات و ارجاعها در متن بلند باید مستقیماً آزموده شود و نمیتوان آن را فقط از طول زمینه نتیجه گرفت.
ارزش این عرضه در شفاف بودن محدودیتهاست
North Small Translate چیزی ملموس برای ارزیابی در اختیار تیمها میگذارد: فایلهای قابلدریافت، چند سطح کمدقتسازی، نیاز سختافزاری مشخص و مدلی که بهجای گفتوگوی عمومی برای ترجمه طراحی شده است.
دلیل اصلی برای آزمایش این مدل لزوماً ادعای برتری آن نسبت به همه رقبا نیست. مزیت مهمتر این است که تیم میتواند همان مدل را در مسیر میزبانیشده و روی زیرساخت خودش بررسی کند و از ابتدا معماری، نیاز اجرایی و مرز مجوز را بداند.
برای استفاده تجاری سه تصمیم باید جدا بمانند: آیا کیفیت مدل برای زبانهای مورد نیاز کافی است، آیا هزینه زیرساخت منطقی است و آیا مجوز انتخابشده حق استفاده مورد نظر را میدهد. North Small Translate دو مورد اول را قابلآزمون و مورد سوم را نسبتاً شفاف کرده است. برچسب open weights نباید جای این سه بررسی را بگیرد.