پژوهشگران Google DeepMind نسخه توسعهیافتهای از Co-Scientist را معرفی کردهاند که از یک سیستم عمدتاً متمرکز بر تولید و ارزیابی فرضیه علمی، به یک چارچوب execution-grounded برای تحقیق تبدیل شده است. این سیستم میتواند آزمایش را برنامهریزی کند، code بنویسد و اجرا کند، با بخشی از تجهیزات آزمایشگاهی تعامل داشته باشد، نتایج را تحلیل کند و manuscript تولید کند. آزمایشها در materials science، synthetic biology و computer science انجام شدهاند و میزان دخالت انسان در هر حوزه متفاوت است.
مهمترین تغییر این نیست که AI میتواند یک فرضیه علمی دیگر پیشنهاد کند. نکته اصلی این است که اکنون بین claimهای تولیدشده و چیزی که واقعاً اجرا شده یک ارتباط صریح وجود دارد. به همین دلیل این paper فقط برای AI for Science مهم نیست و برای معماری agent، provenance و verification نیز ارزش دارد.
از hypothesis generation تا research متصل به execution
نسخه قبلی Co-Scientist عمدتاً روی hypothesis generation و scientific reasoning تمرکز داشت. Google در معرفی Gemini for Science نیز Co-Scientist را بهعنوان یک multi-agent system معرفی کرده بود که فرضیهها را تولید، نقد و ارزیابی میکند.
preprint جدید که ۲۷ اوت ۲۰۲۶ روی arXiv ثبت شده، این loop را به experimentation گسترش میدهد. نویسندگان یک workflow سهمرحلهای شامل ideation، experimentation و paper generation توصیف میکنند. بسته به task، مرحله experiment میتواند code، دستورالعمل machine-readable آزمایشگاه یا artifact اجرایی دیگری تولید کند و سپس observationهای واقعی را بهعنوان evidence وارد مرحله تحلیل کند.
این به معنی «دانشمند آزمایشگاهی کاملاً autonomous» نیست. سطح autonomy بین experimentها تفاوت زیادی دارد. در بخش materials science هنوز انسانها sample و precursor را بارگذاری میکنند، بخشی از workflow فیزیکی را انجام میدهند و characterization را بر عهده دارند. در experiment مربوط به computer science، بعد از تعریف هدف اولیه، فرایند بسیار autonomousتر است.
این تفاوت برای تفسیر درست نتایج حیاتی است.
آزمایش واقعی، اما هنوز با human-in-the-loop
در materials science، سیستم به یک workflow نیمهخودکار chemical vapor deposition متصل شد. Co-Scientist یک مسیر precursor ایمنتر برای bottom-up MXene synthesis پیشنهاد داد و به refinement چندمرحلهای experiment کمک کرد.
پژوهشگران گزارش میکنند یک ماده دوبعدی lamellar با شباهتهای ساختاری به lattice مربوط به Ti3C2Tx MXene تولید شده است. با این حال خود paper تأکید میکند که برای تأیید atomic structure به آزمایشهای بیشتری نیاز است. بنابراین نتیجه مهم است، اما هنوز کشف تأییدشده ماده هدف محسوب نمیشود.
تیم همچنین از Gemini 3 Deep Think برای تطبیق recipeهای رشد semiconductor با محدودیتهای setup آزمایشگاه استفاده کرده است. طبق paper، این روش به رشد monolayerهای MoS2، MoSe2 و WS2 در اولین attempt منجر شد. انسان همچنان precursorها را بارگذاری میکرد، بنابراین این workflow ترکیبی از machine-generated control و مداخله فیزیکی انسان بود.
در synthetic biology، Co-Scientist یک pipeline تصویری برای پیشبینی رفتار colonyهای مهندسیشده E. coli در غلظتهای مختلف IPTG ساخت. predictionها در سه معیار از چهار معیار morphology با measurementهای unpublished آزمایشگاه مطابقت داشتند. نویسندگان همچنین اشاره میکنند که این آزمایش بیشتر interpolation در یک regime شناختهشده است تا پیشبینی یک سیستم زیستی کاملاً جدید.
Agent_H محدودیت benchmark optimization را نشان میدهد
experiment مربوط به computer science از این جهت مهم است که هم توان autonomous search را نشان میدهد و هم محدودیت automated evaluation را.
Co-Scientist با دریافت یک هدف تحقیق و محیط development محدود، architectureای به نام Agent_H برای medical question answering طراحی کرد. این سیستم چند مرحله برای triage، decomposition، parallel candidate generation، selection، critique، verification و response optimization دارد.
طبق paper، Agent_H پس از correction مربوط به طول پاسخ، روی HealthBench Hard و HealthBench Professional از شش frontier-model baseline جلو زد.
اما blinded physician evaluation تصویر محتاطانهتری ارائه کرد. سه پزشک board-certified، Agent_H را در برابر Gemini 3.1 Pro روی ۹ معیار clinical مقایسه کردند. Agent_H فقط در یک معیار تفاوت statistically significant داشت: کاهش احتمال clinical harm.
این فاصله مهم است. یک agent میتواند automated benchmark را optimize کند بدون اینکه همان میزان بهبود در expert human judgment دیده شود. خود paper در نتیجه مثالی ارائه میکند که چرا evaluation یک agent نباید فقط به leaderboard خلاصه شود.
مهمترین ایده قابل استفاده، reliability layer است
قویترین contribution معماری paper تلاش برای متصل کردن claimهای manuscript به execution evidence است.
autonomous research agent یک failure mode واضح دارد: سیستمی که برای تولید نتیجه موفق reward میگیرد ممکن است درباره آزمایشهایی که واقعاً اجرا نشدهاند claimهای کاملاً plausible تولید کند. Co-Scientist ماژولهایی اضافه کرده که fabrication و near-plagiarism را penalize میکنند و یک verifier جداگانه، claimهای عددی را با execution log و artifactهای واقعی تولیدشده تطبیق میدهد.
در یک مطالعه double-blind، ۳۰ متخصص حوزه در مجموع ۴۵۰ review برای ۱۵۰ paper تولیدشده بهصورت autonomous انجام دادند. نویسندگان گزارش میکنند با فعال بودن reliability modules، fabricated key results در ۴٪ paperها دیده شد. این عدد بدون این ماژولها ۴۶٪ و برای comparison baseline برابر ۹۰٪ بود. complete data fabrication در configuration محافظتشده Co-Scientist برابر ۰٪ و در comparison system برابر ۴۴٪ گزارش شد. near-plagiarized content نیز از ۶۰٪ به ۱۶٪ کاهش یافت.
این اختلافها بزرگاند، اما هنوز نتیجه evaluation خود نویسندگان هستند و independent reproduction برای این extension وجود ندارد. این نسخه نیز یک arXiv preprint جدید است و هنوز peer review مستقل برای همین کار تأیید نشده است.
خود نویسندگان نیز failure modeهای باقیمانده را گزارش میکنند. manuscript تولیدشده میتواند selective reporting داشته باشد و description روشها ممکن است plausible باشد اما دقیقاً با code اجراشده تطابق نداشته باشد. بنابراین verification مشکل را بسیار کاهش میدهد، اما traceability و human review را حذف نمیکند.
safety بخشی از execution loop شده است
سیستم برای research directionهای بالقوه خطرناک نیز safety control اضافه کرده است. نویسندگان گزارش میکنند architecture ایمنی آنها در evaluation، ۹۸.۷٪ directionهای unsafe را رد کرده است.
این عدد باید بهعنوان نتیجه گزارششده در test setup خود نویسندگان دیده شود، نه تضمین عمومی laboratory safety. نکته معماری مهمتر این است که safety gating قبل از execution قرار گرفته و صرفاً moderation متن نهایی نیست.
برای scientific agentی که میتواند code اجرا کند یا equipment را کنترل کند، boundary اصلی ریسک خود action است، نه فقط متنی که درباره آن action نوشته میشود.
چرا این موضوع فراتر از AI for Science اهمیت دارد
درس کلی این معماری برای agentهای خارج از research نیز مهم است.
Co-Scientist به الگویی نزدیک میشود که در آن claim نهایی فقط به این دلیل پذیرفته نمیشود که مدل توضیح قانعکنندهای تولید کرده است. claim باید با execution trace، experimental artifact و observation واقعی تطبیق داده شود.
این همان design principleای است که production agentها در software engineering، operations، finance و workflowهای regulated نیز به آن نیاز دارند: generation را از evidence جدا کنید، provenance را حفظ کنید و outputهای مهم را به actionهایی که واقعاً اتفاق افتادهاند قابل trace کنید.
این paper یک «دانشمند کاملاً autonomous» را اثبات نمیکند و چند نتیجه مهم آن هنوز preliminary یا task-specific هستند. اما یک معماری agent بالغتر را نشان میدهد که reasoning، execution و verification را در یک feedback loop واحد قرار میدهد.
ممکن است همین تغییر در بلندمدت از هر experiment منفرد داخل paper مهمتر باشد.