شرکت SpaceXAI در ۲۱ سپتامبر ۲۰۲۶ مدل Grok 4.7 را برای کارهای برنامهنویسی و وظایف چندمرحلهای منتشر کرد. این مدل از طریق API شرکت، محیط Grok Build و Cursor در دسترس قرار گرفته و GitHub نیز عرضه تدریجی آن را در Copilot اعلام کرده است. تعرفه پایه با نسل قبلی تفاوتی ندارد؛ بااینحال، یک قیمت ثابت برای هر توکن چیزی درباره هزینه نهایی یک کار موفق به ما نمیگوید.
ارزیابی مستقل Artificial Analysis از پیشرفت مدل در برخی کارهای طولانی خبر میدهد، اما افزایش مصرف توکن و نتیجه نهچندان یکدست در آزمونهای دیگر هم دیده میشود. بنابراین برای تصمیم به مهاجرت، باید هزینه کل انجام کار را کنار کیفیت خروجی گذاشت، نه اینکه فقط به جدول قیمت یا ادعای سازنده تکیه کرد.
مدل تازه چه امکاناتی دارد؟
در اطلاعیه رسمی، سازنده میگوید مدل پایه را نسبت به Grok 4.6 بزرگتر کرده و آموزش تقویتی طولانیتری با تمرکز بر مسئلههای دشوار انجام داده است. شرکت همچنین از توان بهتر مدل در بررسی کار خودش و هماهنگی با محیط اجرای عاملها سخن میگوید. اینها توضیحات سازنده درباره روند توسعه و عملکرد مدل هستند، نه نتایجی که صرف انتشار اطلاعیه بهطور مستقل اثبات شده باشند.
طبق یادداشت انتشار ۲۱ سپتامبر، شناسه API مدل `grok-4.7` است و حداکثر ۵۰۰ هزار توکن زمینه را میپذیرد. ورودی متن و تصویر و خروجی متن دارد و میتوان میزان پردازش استدلالی را در چهار سطح low، medium، high و xhigh تنظیم کرد؛ سطح پیشفرض high است. در Responses API بخشی با شناسه `reasoning.encrypted_content` همواره برگردانده میشود. برنامهای که مکالمه چندمرحلهای را ادامه میدهد باید اقلام مربوط به استدلال را بدون تغییر در درخواست بعدی بازگرداند.
GitHub اعلام کرده است که مدل بهتدریج به محیطهای مختلف Copilot، از جمله عامل ابری برنامهنویسی و چند ویرایشگر کد، افزوده میشود. مدیران سازمانی میتوانند دسترسی را از طریق سیاست انتخاب مدل کنترل کنند. بنابراین نباید «اعلام عرضه» را به معنای فعالشدن همزمان برای همه کاربران دانست.
آزمون مستقل تصویر دقیقتری از پیشرفت ارائه میکند
Artificial Analysis مدل را با سطح استدلال xhigh آزمایش کرده و برای آن در شاخص کلی خود امتیاز ۴۶ ثبت کرده است؛ دو امتیاز بیشتر از Grok 4.6. در شاخص عامل برنامهنویسی این مؤسسه، هنگام استفاده از Grok Build، امتیاز نسخه جدید از ۴۷ به ۵۶ رسیده است. در بعضی آزمونهای کار حرفهای چندمرحلهای نیز پیشرفت قابل توجهی گزارش شده است.
با این همه، نتیجه به ابزار اجرای عامل وابسته است. امتیاز بهدستآمده با Grok Build صرفاً توان خام مدل را جدا از محیط اجرا اندازه نمیگیرد. در بعضی مؤلفههای دیگر، از جمله یک آزمون بازیابی اطلاعات در متن طولانی و یک آزمون خودکارسازی، عملکرد نسبت به نسل قبل افت داشته است. همچنین مقایسه مدل جدید در سطح xhigh با نسل قبلی در سطح high، بدون توضیح این تفاوت، میتواند برداشت نادرستی ایجاد کند.
جدولهای منتشرشده توسط SpaceXAI از برتری مدل در برخی آزمونهای برنامهنویسی و نسبت هزینه به عملکرد سخن میگویند. این نتایج متعلق به سازندهاند؛ آزمونهای منتشرشده در اکوسیستم Cursor نیز مستقل از مجموعه تجاری مرتبط با مدل نیستند. ارزیابی بیرونی پیشرفت را تأیید میکند، اما از این شواهد نمیتوان نتیجه گرفت که همه پروژهها یا همه وظایف امنیتی و مهندسی با نسخه جدید بهتر انجام میشوند.
قیمت هر توکن ثابت است، نه لزوماً هزینه هر مأموریت
در تعرفه API شرکت، برای درخواستهایی با کمتر از ۲۰۰ هزار توکن ورودی، هر یک میلیون توکن ورودی ۲ دلار، ورودی بازیابیشده از حافظه موقت ۵۰ سنت و خروجی ۶ دلار هزینه دارد. با عبور از این مرز، قیمتها بهترتیب به ۴، ۱ و ۱۲ دلار میرسند. نسخه سریعتر در Cursor و Grok Build عرضه میشود، اما طبق مستندات، در API عمومی xAI در دسترس نیست.
نکته مهم این است که Cursor مرز قیمتگذاری متفاوتی دارد. در آنجا بازه عادی ۲۵۶ هزار توکن و سقف حالت طولانی ۵۰۰ هزار توکن است. وقتی ورودی از ۲۵۶ هزار توکن عبور کند، هزینه تمام درخواست عادی دو برابر نرخ پایه محاسبه میشود. برای حالت سریع با زمینه طولانی، تعرفه به سه برابر نرخ استاندارد میرسد. استفاده از مرز ۲۰۰ هزار توکنی xAI برای برآورد قبض Cursor خطای محاسباتی ایجاد میکند.
در همان ارزیابی مستقل، Grok 4.7 با سطح xhigh برای هر کار حدود ۸۱ هزار توکن خروجی مصرف کرده است؛ این مقدار برای Grok 4.6 در همان سطح حدود ۳۸ هزار توکن بوده است. یعنی خروجی آزمون نسخه جدید بیش از دو برابر شده، درحالیکه تعرفه پایه توکن خروجی ثابت مانده است. البته از این عدد نمیتوان مستقیم هزینه هر کار موفق را استخراج کرد: تعداد تلاشها، توکنهای ورودی، استفاده از حافظه موقت و درصد موفقیت نیز باید محاسبه شوند.
معیار اقتصادی بهتر: هزینه هر خروجی پذیرفتهشده
نتیجه تحلیلی Aipolix از کنار هم گذاشتن تعرفهها و روش آزمون این است که ابتدا باید «کار موفق» را دقیق تعریف کرد. برای نمونه، یک تغییر کد زمانی پذیرفته شود که آزمونهای مشخص را پشت سر بگذارد یا سند تولیدشده واقعاً همه معیارهای تحویل را داشته باشد. سپس دو مدل را با وظایف، ابزارها، نسخه مخزن و سیاست تلاش مجدد یکسان آزمایش کنیم.
در این آزمایش، فقط قیمت توکن ثبت نشود. تعداد خروجیهای پذیرفتهشده، زمان صرفشده برای اصلاح انسانی، مدت اجرا، مصرف ورودی و خروجی، استفاده از حافظه موقت و هزینه همه تلاشهای ناموفق نیز لازم است. مستندات حسابداری xAI فیلد `usage.cost_in_usd_ticks` را برای هزینه واقعی هر درخواست ارائه میکند؛ مبلغ پس از تخفیفها و همراه هزینه ابزارهای سمت سرور محاسبه میشود. این مقدار مربوط به همان درخواست است و برای هزینه کل یک گفتوگو باید مقادیر چند درخواست را با هم جمع کرد.
اگر مدلی با تعرفه برابر دو برابر توکن خروجی تولید کند، باید موفقیت بیشتر، تلاش مجدد کمتر یا نیاز پایینتر به بازبینی انسانی این اضافههزینه را جبران کند. از سوی دیگر، یک اجرای موفق ممکن است از چند تلاش ناموفق با مدلی ظاهراً ارزانتر، کمهزینهتر تمام شود. نسبت واقعی را فقط دادههای همان پروژه مشخص میکنند.
پیش از جایگزینکردن مدل چه چیزی را بسنجیم؟
Grok 4.7 یک عرضه واقعی با امکانات مستند و پیشرفت سنجیدهشده در بعضی کاربردهای عاملمحور است. اما ادعاهای عمومی سازنده درباره سرعت، ایمنی و برتری را نباید بهجای نتیجه مستقل منتشر کرد. تفاوت تعرفه میان ارائهدهندگان، میزان پردازش استدلالی و هزینه متنهای طولانی نیز انتخاب را پیچیده میکند.
راه عملی این است که ابتدا یک آزمون محدود با سطح استدلال موردنظر اجرا شود؛ ابزارها و مجموعه وظایف ثابت بمانند و بخشی از آزمون به درخواستهای طولانی اختصاص یابد. در سازمانهایی که از Copilot استفاده میکنند، مجوز دسترسی به مدل نیز بررسی شود و نسخه قبلی بهعنوان گزینه جایگزین باقی بماند. تصمیم گسترش استفاده باید بر اساس خروجی پذیرفتهشده و هزینه کامل باشد، نه صرفاً یک امتیاز در جدول مقایسه.