شرکت SpaceXAI در ۲۱ سپتامبر ۲۰۲۶ مدل Grok 4.7 را برای کارهای برنامه‌نویسی و وظایف چندمرحله‌ای منتشر کرد. این مدل از طریق API شرکت، محیط Grok Build و Cursor در دسترس قرار گرفته و GitHub نیز عرضه تدریجی آن را در Copilot اعلام کرده است. تعرفه پایه با نسل قبلی تفاوتی ندارد؛ بااین‌حال، یک قیمت ثابت برای هر توکن چیزی درباره هزینه نهایی یک کار موفق به ما نمی‌گوید.

ارزیابی مستقل Artificial Analysis از پیشرفت مدل در برخی کارهای طولانی خبر می‌دهد، اما افزایش مصرف توکن و نتیجه نه‌چندان یکدست در آزمون‌های دیگر هم دیده می‌شود. بنابراین برای تصمیم به مهاجرت، باید هزینه کل انجام کار را کنار کیفیت خروجی گذاشت، نه اینکه فقط به جدول قیمت یا ادعای سازنده تکیه کرد.

مدل تازه چه امکاناتی دارد؟

در اطلاعیه رسمی، سازنده می‌گوید مدل پایه را نسبت به Grok 4.6 بزرگ‌تر کرده و آموزش تقویتی طولانی‌تری با تمرکز بر مسئله‌های دشوار انجام داده است. شرکت همچنین از توان بهتر مدل در بررسی کار خودش و هماهنگی با محیط اجرای عامل‌ها سخن می‌گوید. این‌ها توضیحات سازنده درباره روند توسعه و عملکرد مدل هستند، نه نتایجی که صرف انتشار اطلاعیه به‌طور مستقل اثبات شده باشند.

طبق یادداشت انتشار ۲۱ سپتامبر، شناسه API مدل `grok-4.7` است و حداکثر ۵۰۰ هزار توکن زمینه را می‌پذیرد. ورودی متن و تصویر و خروجی متن دارد و می‌توان میزان پردازش استدلالی را در چهار سطح low، medium، high و xhigh تنظیم کرد؛ سطح پیش‌فرض high است. در Responses API بخشی با شناسه `reasoning.encrypted_content` همواره برگردانده می‌شود. برنامه‌ای که مکالمه چندمرحله‌ای را ادامه می‌دهد باید اقلام مربوط به استدلال را بدون تغییر در درخواست بعدی بازگرداند.

GitHub اعلام کرده است که مدل به‌تدریج به محیط‌های مختلف Copilot، از جمله عامل ابری برنامه‌نویسی و چند ویرایشگر کد، افزوده می‌شود. مدیران سازمانی می‌توانند دسترسی را از طریق سیاست انتخاب مدل کنترل کنند. بنابراین نباید «اعلام عرضه» را به معنای فعال‌شدن هم‌زمان برای همه کاربران دانست.

آزمون مستقل تصویر دقیق‌تری از پیشرفت ارائه می‌کند

Artificial Analysis مدل را با سطح استدلال xhigh آزمایش کرده و برای آن در شاخص کلی خود امتیاز ۴۶ ثبت کرده است؛ دو امتیاز بیشتر از Grok 4.6. در شاخص عامل برنامه‌نویسی این مؤسسه، هنگام استفاده از Grok Build، امتیاز نسخه جدید از ۴۷ به ۵۶ رسیده است. در بعضی آزمون‌های کار حرفه‌ای چندمرحله‌ای نیز پیشرفت قابل توجهی گزارش شده است.

با این همه، نتیجه به ابزار اجرای عامل وابسته است. امتیاز به‌دست‌آمده با Grok Build صرفاً توان خام مدل را جدا از محیط اجرا اندازه نمی‌گیرد. در بعضی مؤلفه‌های دیگر، از جمله یک آزمون بازیابی اطلاعات در متن طولانی و یک آزمون خودکارسازی، عملکرد نسبت به نسل قبل افت داشته است. همچنین مقایسه مدل جدید در سطح xhigh با نسل قبلی در سطح high، بدون توضیح این تفاوت، می‌تواند برداشت نادرستی ایجاد کند.

جدول‌های منتشرشده توسط SpaceXAI از برتری مدل در برخی آزمون‌های برنامه‌نویسی و نسبت هزینه به عملکرد سخن می‌گویند. این نتایج متعلق به سازنده‌اند؛ آزمون‌های منتشرشده در اکوسیستم Cursor نیز مستقل از مجموعه تجاری مرتبط با مدل نیستند. ارزیابی بیرونی پیشرفت را تأیید می‌کند، اما از این شواهد نمی‌توان نتیجه گرفت که همه پروژه‌ها یا همه وظایف امنیتی و مهندسی با نسخه جدید بهتر انجام می‌شوند.

قیمت هر توکن ثابت است، نه لزوماً هزینه هر مأموریت

در تعرفه API شرکت، برای درخواست‌هایی با کمتر از ۲۰۰ هزار توکن ورودی، هر یک میلیون توکن ورودی ۲ دلار، ورودی بازیابی‌شده از حافظه موقت ۵۰ سنت و خروجی ۶ دلار هزینه دارد. با عبور از این مرز، قیمت‌ها به‌ترتیب به ۴، ۱ و ۱۲ دلار می‌رسند. نسخه سریع‌تر در Cursor و Grok Build عرضه می‌شود، اما طبق مستندات، در API عمومی xAI در دسترس نیست.

نکته مهم این است که Cursor مرز قیمت‌گذاری متفاوتی دارد. در آنجا بازه عادی ۲۵۶ هزار توکن و سقف حالت طولانی ۵۰۰ هزار توکن است. وقتی ورودی از ۲۵۶ هزار توکن عبور کند، هزینه تمام درخواست عادی دو برابر نرخ پایه محاسبه می‌شود. برای حالت سریع با زمینه طولانی، تعرفه به سه برابر نرخ استاندارد می‌رسد. استفاده از مرز ۲۰۰ هزار توکنی xAI برای برآورد قبض Cursor خطای محاسباتی ایجاد می‌کند.

در همان ارزیابی مستقل، Grok 4.7 با سطح xhigh برای هر کار حدود ۸۱ هزار توکن خروجی مصرف کرده است؛ این مقدار برای Grok 4.6 در همان سطح حدود ۳۸ هزار توکن بوده است. یعنی خروجی آزمون نسخه جدید بیش از دو برابر شده، درحالی‌که تعرفه پایه توکن خروجی ثابت مانده است. البته از این عدد نمی‌توان مستقیم هزینه هر کار موفق را استخراج کرد: تعداد تلاش‌ها، توکن‌های ورودی، استفاده از حافظه موقت و درصد موفقیت نیز باید محاسبه شوند.

معیار اقتصادی بهتر: هزینه هر خروجی پذیرفته‌شده

نتیجه تحلیلی Aipolix از کنار هم گذاشتن تعرفه‌ها و روش آزمون این است که ابتدا باید «کار موفق» را دقیق تعریف کرد. برای نمونه، یک تغییر کد زمانی پذیرفته شود که آزمون‌های مشخص را پشت سر بگذارد یا سند تولیدشده واقعاً همه معیارهای تحویل را داشته باشد. سپس دو مدل را با وظایف، ابزارها، نسخه مخزن و سیاست تلاش مجدد یکسان آزمایش کنیم.

در این آزمایش، فقط قیمت توکن ثبت نشود. تعداد خروجی‌های پذیرفته‌شده، زمان صرف‌شده برای اصلاح انسانی، مدت اجرا، مصرف ورودی و خروجی، استفاده از حافظه موقت و هزینه همه تلاش‌های ناموفق نیز لازم است. مستندات حسابداری xAI فیلد `usage.cost_in_usd_ticks` را برای هزینه واقعی هر درخواست ارائه می‌کند؛ مبلغ پس از تخفیف‌ها و همراه هزینه ابزارهای سمت سرور محاسبه می‌شود. این مقدار مربوط به همان درخواست است و برای هزینه کل یک گفت‌وگو باید مقادیر چند درخواست را با هم جمع کرد.

اگر مدلی با تعرفه برابر دو برابر توکن خروجی تولید کند، باید موفقیت بیشتر، تلاش مجدد کمتر یا نیاز پایین‌تر به بازبینی انسانی این اضافه‌هزینه را جبران کند. از سوی دیگر، یک اجرای موفق ممکن است از چند تلاش ناموفق با مدلی ظاهراً ارزان‌تر، کم‌هزینه‌تر تمام شود. نسبت واقعی را فقط داده‌های همان پروژه مشخص می‌کنند.

پیش از جایگزین‌کردن مدل چه چیزی را بسنجیم؟

Grok 4.7 یک عرضه واقعی با امکانات مستند و پیشرفت سنجیده‌شده در بعضی کاربردهای عامل‌محور است. اما ادعاهای عمومی سازنده درباره سرعت، ایمنی و برتری را نباید به‌جای نتیجه مستقل منتشر کرد. تفاوت تعرفه میان ارائه‌دهندگان، میزان پردازش استدلالی و هزینه متن‌های طولانی نیز انتخاب را پیچیده می‌کند.

راه عملی این است که ابتدا یک آزمون محدود با سطح استدلال موردنظر اجرا شود؛ ابزارها و مجموعه وظایف ثابت بمانند و بخشی از آزمون به درخواست‌های طولانی اختصاص یابد. در سازمان‌هایی که از Copilot استفاده می‌کنند، مجوز دسترسی به مدل نیز بررسی شود و نسخه قبلی به‌عنوان گزینه جایگزین باقی بماند. تصمیم گسترش استفاده باید بر اساس خروجی پذیرفته‌شده و هزینه کامل باشد، نه صرفاً یک امتیاز در جدول مقایسه.

Sources
- https://x.ai/news/grok-4-7
- https://docs.x.ai/developers/release-notes
- https://artificialanalysis.ai/articles/benchmarking-grok-4-7
- https://prod.cursor.com/docs/models/grok-4-7
- https://docs.x.ai/developers/cost-tracking
- https://github.blog/changelog/2026-09-21-grok-4-7-is-now-available-in-github-copilot/