پروژه AMALIA پرتغال یک مدل زبانی ۹ میلیارد پارامتری قابل استقرار را که مشخصاً برای پرتغالی اروپایی طراحی شده، همراه با دادههای آموزشی، منابع ارزیابی و مسیر عمومی deployment منتشر کرده است. نسخه نهایی AMALIA در ۱ ژوئیه ۲۰۲۶ بهصورت عمومی در دسترس قرار گرفت و checkpoint فعلی 0626 DPO تحت مجوز Apache 2.0 از طریق سازمان رسمی پروژه در Hugging Face توزیع میشود.
اهمیت فنی این release فقط این نیست که پرتغال یک chatbot ملی دیگر دارد. AMALIA pretraining مدل EuroLLM را با دادههای بیشتر پرتغالی اروپایی ادامه میدهد، حداکثر طول context را به ۳۲ هزار token افزایش میدهد و سپس supervised fine-tuning و Direct Preference Optimization را اعمال میکند. پروژه همچنین datasetهای SFT و DPO و یک مجموعه ارزیابی مخصوص pt-PT را منتشر کرده است، بنابراین نسبت به مدلی که فقط از طریق یک interface میزبانیشده ارائه میشود، قابلیت بررسی بیشتری دارد.
یک مدل 9B برای پرتغالی اروپایی
طبق model card رسمی AMALIA، پروژه از دادههای Arquivo.pt، دادههای pretraining مدل EuroLLM، نمونههای long-context از Stack-v2 و دادههای synthetic برای حفظ context طولانی استفاده کرده است. مرحله post-training نیز supervised fine-tuning را با preference tuning از طریق DPO ترکیب میکند.
مرحله SFT به مدت ۷۶ ساعت روی ۶۴ GPU مدل NVIDIA H100 اجرا شده و مرحله DPO نیز ۱۲ ساعت دیگر با همان تعداد GPU ادامه یافته است. آموزش روی ابررایانه MareNostrum 5 در Barcelona Supercomputing Center و سامانه DEUCALION در Minho Advanced Computing Center انجام شده است.
برای developerهای پرتغالی، نکته مهم این است که AMALIA بهعنوان یک base model قابل استفاده مجدد ارائه شده، نه فقط یک demo عمومی. پروژه checkpoint، دادهها و ابزارهای ارزیابی را با مجوزهای باز منتشر کرده است تا تیمها بتوانند آن را بررسی، fine-tune و داخل زیرساخت خود serve کنند.
ارزیابی native برای pt-PT بخشی از پروژه است
گزارش فنی AMALIA استدلال میکند که پرتغالی اروپایی نهفقط در دادههای آموزشی، بلکه در benchmarkها نیز کمتر از حد لازم نمایندگی شده است. benchmarkهای ترجمهشده ماشینی ممکن است تفاوتهای واژگانی، دستوری و فرهنگی میان پرتغالی اروپا و برزیل را بهخوبی اندازهگیری نکنند.
برای حل این مشکل، پروژه benchmarkهای pt-PT را منتشر کرده که taskهای استاندارد ترجمهشده را با datasetهای جدید برای تولید متن پرتغالی اروپایی، competence زبانی و bias میان pt-PT و pt-BR ترکیب میکنند. نویسندگان گزارش میکنند که AMALIA روی benchmarkهای ترجمهشده با baselineهای قوی رقابتی است و روی ارزیابیهایی که مشخصاً برای پرتغالی اروپایی طراحی شدهاند بهبود نشان میدهد.
این نتایج باید بهعنوان یافتههای گزارششده توسط خود پروژه دیده شوند، نه اثبات مستقل اینکه AMALIA بهطور کلی از مدلهای frontier تجاری بهتر است. سیگنال مهندسی مهمتر این است که تیم یک سطح ارزیابی ساخته که برای تشخیص رفتار pt-PT طراحی شده و میتواند ضعف benchmarkهای چندزبانه عمومی را آشکار کند.
استقرار با endpoint سازگار با OpenAI
راهنمای رسمی GitHub استفاده از vLLM را برای serve کردن checkpoint مدل 0626 DPO پیشنهاد میکند. دستور استاندارد vLLM مدل را بهصورت محلی اجرا میکند و یک API سازگار با chat-completions سبک OpenAI در اختیار application قرار میدهد.
این موضوع قرار دادن AMALIA در معماریهای موجود را سادهتر میکند. یک تیم میتواند مدل را بهصورت local یا private inference service اجرا کند، دادهها را در زیرساخت تحت کنترل خودش نگه دارد و workloadهای منتخب پرتغالی را بدون بازنویسی کامل client layer به AMALIA route کند.
مقیاس 9B از نظر عملیاتی هم مهم است. این مدل بسیار کوچکتر از frontier modelهاست و community quantizationهایی برای llama.cpp و Apple Silicon نیز برای آن ساخته شده، هرچند این buildهای مشتقشده artifactهای community هستند و بخشی از release رسمی محسوب نمیشوند.
AMALIA بهعنوان زیرساخت AI حاکمیتی پرتغال
اعلامیه Digital.gov.pt AMALIA را نخستین مدل زبانی بزرگ طراحیشده مشخصاً برای پرتغالی اروپایی و context فرهنگی ملی معرفی میکند. release ماه ژوئیه یک شاخه multimodal نیز دارد، اما stack متنی بهتنهایی برای developerها ارزش عملی دارد چون weights، datasetها و مسیر serving آن هماکنون در دسترس است.
بحث sovereign AI نباید صرفاً به ملیت مدل تقلیل پیدا کند. ارزش ملموستر در کنترل روی stack فنی است: model weights، disclosure دادههای آموزشی، منابع evaluation و انتخاب deployment. این میتواند برای سامانههای دولتی، workloadهای regulated، محصولهای زبانمحور و researchهایی مهم باشد که وابستگی به API اختصاصی remote مطلوب نیست.
AMALIA نیاز به security review، ارزیابی domain-specific یا مقایسه با مدلهای بزرگتر را حذف نمیکند. model card رسمی نیز input validation و output filtering متناسب با deployment را توصیه میکند و knowledge cutoff مدل ژوئن ۲۰۲۴ است. تیمها باید taskهای واقعی خود را benchmark کنند و فرض نکنند specialization برای pt-PT همیشه اختلاف در reasoning عمومی، tool use یا تازگی اطلاعات را جبران میکند.
برای مخاطب Aipolix، AMALIA بهتر است بهعنوان یک قطعه جدید از زیرساخت AI پرتغال دیده شود: نه ادعایی برای جایگزینی frontier systemهای جهانی، بلکه یک مدل باز و قابل استقرار که برای پرتغالی اروپایی مسیر قویتری برای inference محلی، adaptation و evaluation ایجاد میکند.