
امروزه تصور بهرهوری حرفهای بدون کمک گرفتن از هوش مصنوعی تقریباً ناممکن شده است. بیشتر توسعهدهندگان، طراحان، فعالان تبلیغات و تولیدکنندگان محتوا دستکم به یک مدل هوش مصنوعی در جریان کاری خود وابستهاند و بهندرت دلیلی برای تغییر آن پیدا میکنند؛ چراکه وقتی کاربری هزینه اشتراک یک سرویس را پرداخت میکند، عملاً به یک زیستبوم (Ecosystem) کامل گره خورده و مهاجرت به سرویسی دیگر دردسری است که کسی بهراحتی زیر بار آن نمیرود.
اما این رویکرد یک ایراد اساسی دارد: ارائهدهندگان ابری (Cloud Providers) بهطور مداوم مدلهای تازهای با توان استدلال (Reasoning) بالاتر و قابلیتهای جدید روانه بازار میکنند و ماندن روی یک سرویس ثابت، به معنای از دست دادن بخشی از این پیشرفتهاست. به همین دلیل، دو مدل برتر شرکتهای انتروپیک (Anthropic) و گوگل در بالاترین سطح توان پردازشی، با سه پرامپت (Prompt) روزمره و واقعی آزمایش شدند تا مشخص شود کدامیک ارزش پرداخت هزینه اشتراک را دارد.
آزمون نخست: ساخت یک وبسایت با HTML
ساخت وبسایت یکی از رایجترین کارهایی است که کاربران به مدلهای زبانی بزرگ (LLM) ابری میسپارند. بیشتر این درخواستها مختصر و بدون اشاره به پالت رنگی، لحن متن یا جایگاه خدمات در صفحه مطرح میشوند و این جزئیات تازه در مرحله تنظیم دقیق (Fine-tuning) مشخص میشوند؛ یعنی زمانی که کاربر پیشتر درباره سفارش یا عدم سفارش سایت تصمیم گرفته است.
برای شبیهسازی همین شرایط، پرامپت زیر عیناً به هر دو مدل داده شد:
«یک صفحه فرود (Landing Page) برای یک کسبوکار کوچک محلی محوطهسازی به نام Green & Co با HTML بساز. باید حرفهای، مدرن و قابلاعتماد به نظر برسد و تماس گرفتن و درخواست قیمت را برای مشتریان بالقوه ساده کند.»
واژه کلیدی «قابلاعتماد» در این درخواست، چارچوب مشخصی دارد؛ گروه نیلسن نورمن در سال ۱۹۹۹ چهار عامل کیفیت طراحی، شفافیت اولیه، محتوای جامع و درست، و اتصال آشکار به سایر بخشهای وب را برای اعتماد در طراحی سایت معرفی کرد که همچنان معیار معتبری است.
در این آزمون، کلود اپوس ۵.۵ برنده شد. طراحی آن بصری و جذاب بود، پیامرسانی جامعیت داشت و سلسلهمراتب بصری آن با استانداردهای رایج وب همخوانی داشت. نکته برجسته آن، ارائه راهنمایی دقیق برای ساختاربندی بهتر محتوا و شفافسازی خدمات بود.
در مقابل، جمینای طراحی تخت و مینیمالیستی را انتخاب کرد که درخواست را بهصورت تحتاللفظی برآورده میکرد، اما در آزمونی بدون نمونه اولیه (Zero-shot) این رویکرد به سطحیشدن میانجامد. در خروجی آن، شبکه خدمات آیکوندار و تصویرسازی خدماتی که یک کسبوکار محوطهسازی بتواند به مشتری نشان دهد وجود نداشت و بخش پرسشهای متداول (FAQ) هم که برای سایتهای خدماتی امری استاندارد است، حذف شده بود.
آزمون دوم: ساخت یک ارائه تصویری
تبدیل ایدههای خام به اسلاید یکی از پرکاربردترین کارهایی است که به مدلهای زبانی سپرده میشود. پرسش اصلی این بود که کدام مدل با کمترین زمینه (Context) میتواند ساختار یک روایت را بهدرستی حدس بزند. معیارهای ارزیابی، کیفیت داده، کمک بصری و جریان منطقی بودند و پرامپت چنین بود:
«یک ارائه پنجاسلایدی بساز که توضیح دهد چرا افزایش قیمت حافظه، هزینه قطعات را در سراسر جهان بالا برده است. آن را برای مخاطب عمومی از نظر بصری قابلهضم کن.»
در این آزمون، کلود اپوس ۵.۵ با فاصلهای چشمگیر برنده شد. تمام اعداد ذکرشده در اسلایدها به منبع اصلی ارجاع داشتند؛ از سهم درآمد حافظههای DRAM و نمودارهای قیمت قراردادهای فصلی تا افزایش قیمت محصولات اشارهشده. اطلاعات شفاف و قابلراستیآزمایی بود و دامنه گستردهای را پوشش میداد که برای مخاطب عمومی جذاب است.
خروجی جمینای با همان پرامپت، از نظر بصری تمیز به نظر میرسید، اما با نگاه به محتوا، منبعدهی مشکوک یا نبود منبع آشکار میشد. تنها ارجاع یافتشده در آن ارائه، مربوط به تصویری بود که از یک تولیدکننده تصویر هوش مصنوعی به نام Easy Peasy AI گرفته شده بود و اسلاید منابع تصاویر در انتها با فونت پیشفرض سریف روی پسزمینه سفید قرار داشت که با زبان طراحی خود ارائه همخوان نبود.
آزمون سوم: توضیح مفهوم به زبان ساده (ELI5)
بسیاری از کاربران هنگام روبهرو شدن با مفاهیم انتزاعی، مستقیماً سراغ هوش مصنوعی ابری مورد علاقه خود میروند. در نظرسنجی سال ۲۰۲۶ نهاد HEPI، ۹۵ درصد دانشجویان آموزش عالی اعلام کردند دستکم به یک شکل از هوش مصنوعی استفاده میکنند.
پرامپت «مثل یک کودک پنجساله توضیح بده» (ELI5) مدلها را در سادهسازی مفاهیم فنی به زبان روزمره محک میزند. در این آزمون مفهوم دوشاخهسازی (Bifurcation) در رابط PCIe انتخاب شد:
«دوشاخهسازی PCIe را مثل یک کودک پنجساله توضیح بده. از هر ابزاری که میخواهی، از جمله تصاویر تعاملی، استفاده کن.»
برای نخستین بار در این مجموعه آزمونها، جمینای ۳.۱ پرو در یک جنبه جلو افتاد. کلید تعاملی آن تمیزتر بود و قیاس بزرگراه مشترک در همان خوانش اول کاملاً قابلفهم به نظر میرسید. با این حال، برچسبهای زیر آن کاملاً نادرست بودند؛ سرعت اسلاتها اشتباه برچسب خورده بود و اسلاتها PCIe 4.0 و 5.0 نامگذاری شده بودند، در حالی که همه اعداد پهنای باند متعلق به نسل 4.0 بود.
کلود نیز مسیر مشابهی را رفت و قیاس جاده و خانههایش بههمان اندازه قابلهضم بود. تصویر تعاملی تولیدشده توسط کلود جذابیت بصری کمتری داشت، اما نکته کلیدیای را پوشش میداد که بسیاری را در مورد دوشاخهسازی PCIe به دام میاندازد: ویجت آن نشان میداد یک آداپتور ارزان چهاردرایو تا زمانی که تقسیمبندی بهصورت دستی تغییر نکند، فقط یک حافظه SSD را شناسایی میکند؛ همان مشکلی که کاربران را پس از نخستین خرید به انجمنهای پشتیبانی میکشاند. در عوض، متن توضیحی کلود به جزئیات منوی BIOS و تراشههای سوئیچ وارد شد که برای کسی که صریحاً توضیح کودکانه خواسته، چندان قابلفهم نیست.
در مجموع، هرچند اپوس ۵.۵ مفهوم را دقیقتر به تصویر کشید، معیارهای ارزیابی در هر دو پاسخ تا حد زیادی برآورده نشد و این آزمون عملاً مساوی اعلام شد؛ هرچند میتوان یک امتیاز را به دلیل بصریسازی به جمینای و یک امتیاز را به دلیل دقت فنی به کلود داد.
جمعبندی: کلود اشتراک را حفظ کرد
در مجموع سه آزمون، کلود در دو مورد پیشتاز بود و یکی مساوی شد. باید توجه داشت که جمینای از این دو سریعتر بود و تواناییهایش در وظایف بصری، مانند کلید تعاملی PCIe، بهتر نمایان میشود.
نکته دیگر اینکه مجموعه جمینای تولید تصویر و ویدیو را منحصراً از طریق Gemini Omni ارائه میکند؛ قابلیتی که در آزمون توضیح ساده انتظار میرفت، اما به نظر میرسد جمینای بهطور خودکار در میانه گفتوگو آن را فراخوانی نمیکند. اگر امروز قرار باشد یکی از این دو سرویس انتخاب شود، انتخاب نویسنده سرویس انتروپیک است؛ دستکم برای حال حاضر.