پروژه AMALIA پرتغال یک مدل زبانی ۹ میلیارد پارامتری قابل استقرار را که مشخصاً برای پرتغالی اروپایی طراحی شده، همراه با داده‌های آموزشی، منابع ارزیابی و مسیر عمومی deployment منتشر کرده است. نسخه نهایی AMALIA در ۱ ژوئیه ۲۰۲۶ به‌صورت عمومی در دسترس قرار گرفت و checkpoint فعلی 0626 DPO تحت مجوز Apache 2.0 از طریق سازمان رسمی پروژه در Hugging Face توزیع می‌شود.

اهمیت فنی این release فقط این نیست که پرتغال یک chatbot ملی دیگر دارد. AMALIA pretraining مدل EuroLLM را با داده‌های بیشتر پرتغالی اروپایی ادامه می‌دهد، حداکثر طول context را به ۳۲ هزار token افزایش می‌دهد و سپس supervised fine-tuning و Direct Preference Optimization را اعمال می‌کند. پروژه همچنین datasetهای SFT و DPO و یک مجموعه ارزیابی مخصوص pt-PT را منتشر کرده است، بنابراین نسبت به مدلی که فقط از طریق یک interface میزبانی‌شده ارائه می‌شود، قابلیت بررسی بیشتری دارد.

یک مدل 9B برای پرتغالی اروپایی

طبق model card رسمی AMALIA، پروژه از داده‌های Arquivo.pt، داده‌های pretraining مدل EuroLLM، نمونه‌های long-context از Stack-v2 و داده‌های synthetic برای حفظ context طولانی استفاده کرده است. مرحله post-training نیز supervised fine-tuning را با preference tuning از طریق DPO ترکیب می‌کند.

مرحله SFT به مدت ۷۶ ساعت روی ۶۴ GPU مدل NVIDIA H100 اجرا شده و مرحله DPO نیز ۱۲ ساعت دیگر با همان تعداد GPU ادامه یافته است. آموزش روی ابررایانه MareNostrum 5 در Barcelona Supercomputing Center و سامانه DEUCALION در Minho Advanced Computing Center انجام شده است.

برای developerهای پرتغالی، نکته مهم این است که AMALIA به‌عنوان یک base model قابل استفاده مجدد ارائه شده، نه فقط یک demo عمومی. پروژه checkpoint، داده‌ها و ابزارهای ارزیابی را با مجوزهای باز منتشر کرده است تا تیم‌ها بتوانند آن را بررسی، fine-tune و داخل زیرساخت خود serve کنند.

ارزیابی native برای pt-PT بخشی از پروژه است

گزارش فنی AMALIA استدلال می‌کند که پرتغالی اروپایی نه‌فقط در داده‌های آموزشی، بلکه در benchmarkها نیز کمتر از حد لازم نمایندگی شده است. benchmarkهای ترجمه‌شده ماشینی ممکن است تفاوت‌های واژگانی، دستوری و فرهنگی میان پرتغالی اروپا و برزیل را به‌خوبی اندازه‌گیری نکنند.

برای حل این مشکل، پروژه benchmarkهای pt-PT را منتشر کرده که taskهای استاندارد ترجمه‌شده را با datasetهای جدید برای تولید متن پرتغالی اروپایی، competence زبانی و bias میان pt-PT و pt-BR ترکیب می‌کنند. نویسندگان گزارش می‌کنند که AMALIA روی benchmarkهای ترجمه‌شده با baselineهای قوی رقابتی است و روی ارزیابی‌هایی که مشخصاً برای پرتغالی اروپایی طراحی شده‌اند بهبود نشان می‌دهد.

این نتایج باید به‌عنوان یافته‌های گزارش‌شده توسط خود پروژه دیده شوند، نه اثبات مستقل اینکه AMALIA به‌طور کلی از مدل‌های frontier تجاری بهتر است. سیگنال مهندسی مهم‌تر این است که تیم یک سطح ارزیابی ساخته که برای تشخیص رفتار pt-PT طراحی شده و می‌تواند ضعف benchmarkهای چندزبانه عمومی را آشکار کند.

استقرار با endpoint سازگار با OpenAI

راهنمای رسمی GitHub استفاده از vLLM را برای serve کردن checkpoint مدل 0626 DPO پیشنهاد می‌کند. دستور استاندارد vLLM مدل را به‌صورت محلی اجرا می‌کند و یک API سازگار با chat-completions سبک OpenAI در اختیار application قرار می‌دهد.

این موضوع قرار دادن AMALIA در معماری‌های موجود را ساده‌تر می‌کند. یک تیم می‌تواند مدل را به‌صورت local یا private inference service اجرا کند، داده‌ها را در زیرساخت تحت کنترل خودش نگه دارد و workloadهای منتخب پرتغالی را بدون بازنویسی کامل client layer به AMALIA route کند.

مقیاس 9B از نظر عملیاتی هم مهم است. این مدل بسیار کوچک‌تر از frontier modelهاست و community quantizationهایی برای llama.cpp و Apple Silicon نیز برای آن ساخته شده، هرچند این buildهای مشتق‌شده artifactهای community هستند و بخشی از release رسمی محسوب نمی‌شوند.

AMALIA به‌عنوان زیرساخت AI حاکمیتی پرتغال

اعلامیه Digital.gov.pt AMALIA را نخستین مدل زبانی بزرگ طراحی‌شده مشخصاً برای پرتغالی اروپایی و context فرهنگی ملی معرفی می‌کند. release ماه ژوئیه یک شاخه multimodal نیز دارد، اما stack متنی به‌تنهایی برای developerها ارزش عملی دارد چون weights، datasetها و مسیر serving آن هم‌اکنون در دسترس است.

بحث sovereign AI نباید صرفاً به ملیت مدل تقلیل پیدا کند. ارزش ملموس‌تر در کنترل روی stack فنی است: model weights، disclosure داده‌های آموزشی، منابع evaluation و انتخاب deployment. این می‌تواند برای سامانه‌های دولتی، workloadهای regulated، محصول‌های زبان‌محور و researchهایی مهم باشد که وابستگی به API اختصاصی remote مطلوب نیست.

AMALIA نیاز به security review، ارزیابی domain-specific یا مقایسه با مدل‌های بزرگ‌تر را حذف نمی‌کند. model card رسمی نیز input validation و output filtering متناسب با deployment را توصیه می‌کند و knowledge cutoff مدل ژوئن ۲۰۲۴ است. تیم‌ها باید taskهای واقعی خود را benchmark کنند و فرض نکنند specialization برای pt-PT همیشه اختلاف در reasoning عمومی، tool use یا تازگی اطلاعات را جبران می‌کند.

برای مخاطب Aipolix، AMALIA بهتر است به‌عنوان یک قطعه جدید از زیرساخت AI پرتغال دیده شود: نه ادعایی برای جایگزینی frontier systemهای جهانی، بلکه یک مدل باز و قابل استقرار که برای پرتغالی اروپایی مسیر قوی‌تری برای inference محلی، adaptation و evaluation ایجاد می‌کند.

Sources
- AMALIA: versão multimodal lançada no dia 1 de julho
- amalia-llm/AMALIA-9B-0626-DPO
- AMALIA Technical Report
- AMALIA repository and deployment quickstart