مدلهای زبانی بزرگ (LLM) بیش از حدی وجود دارند که بتوان به درستی آنها را آزمایش کرد. میتوانید با چند مدل چت کنید، مدل مورد علاقه خود را انتخاب کنید و به سراغ کار بعدی بروید، اما من به روشی بهتر برای مقایسه مدلهای هوش مصنوعی با یکدیگر نیاز داشتم.
هنگامی که برای یک کار جدید به یک LLM نیاز دارم، مانند رتبهبندی یک لیست و برگرداندن JSON تمیز، به ندرت میدانم که آیا به یک مدل مرزی غولپیکر با هزینه یک دلار به ازای هر درخواست نیاز دارم یا یک مدل محلی ۸ میلیارد پارامتری که روی مکبوک من اجرا میشود.
به همین دلیل است که یک تست دود (Smoke Test) خوب اهمیت دارد. این تست باید سریع باشد، تکرار آن آسان باشد و نتایج واضحی را به همراه داشته باشد. تاکنون، تست محبوب من «تست پلیکان» (The Pelican Test) است.
تست عجیب پلیکان
تصاویر SVG تست پلیکان را کاربردی میکنند

سایمون ویلیسون (Simon Willison)، توسعهدهنده و محقق هوش مصنوعی، این تست را در ۲۵ اکتبر ۲۰۲۴ معرفی کرد. در نگاه اول، این تست فقط یک درخواست احمقانه دیگر به نظر میرسد. اما در واقع یکی از سختترین چالشهایی است که میتوانید به یک LLM بدهید.
او در ابتدا آن را روی ۱۶ مدل از OpenAI، Anthropic، Google و Meta آزمایش کرد. مدل مورد علاقه فعلی او، Claude ۳.۵ Sonnet، در اولین تلاش شکست خورد.
تصاویر SVG (گرافیک برداری مقیاسپذیر) تصویر هستند، اما فقط پس از رندر شدن. احتمالاً آنها را به عنوان فایلهای تصویری بدون افت کیفیت میشناسید، اما در زیربنای خود، SVG فقط کد XML است که به رایانه میگوید چگونه اشکال را رسم کند. تست سایمون ویلیسون از این موضوع به نفع خود استفاده میکند. او این پرامپت ساده را ارسال کرد:
یک SVG از یک پلیکان سوار بر دوچرخه تولید کن. (Generate an SVG of a pelican riding a bicycle.)
قضاوت در مورد آن نیز آسان است. هیچ پاسخنامه یا امتیاز انتزاعی برای تفسیر وجود ندارد. شما فقط کد را در یک مرورگر کپی میکنید. اگر یک پلیکان سوار بر دوچرخه دیدید، مدل قبول شده است.
این پرامپت منفرد در نهایت توانایی پیروی از دستورالعملها، کدنویسی، سینتکس معتبر، استدلال فضایی و نمایش بصری مدل را آزمایش میکند. همچنین به مدل اجازه نمیدهد در پشت خروجیهای پرمخاطره پنهان شود — فقط یک کد SVG خام به شما میدهد.
علاوه بر این، اطلاعاتی در مورد محصولِ پیرامونِ مدل نیز به شما میدهد. رابطهای کاربری ChatGPT، Claude و Gemini سعی میکنند به جای ارائه کد خام، فایل را برای شما رندر کنند و نقاط قوت و ضعف محصول را آشکار میسازند.
حتی مدلهای مرزی بزرگ نیز با پلیکان مشکل دارند
Gemini پیروز شد، اما نه کاملاً بینقص

من پرامپت را روی Claude، Gemini و ChatGPT آزمایش کردم. از APIهای آنها استفاده نکردم. من از رابطهای کاربری وب استانداردِ پولی استفاده کردم زیرا میخواستم محصول را آزمایش کنم، نه فقط مدل را.



شما میتوانید نتایج را در گالریهای پیوست شده مشاهده کنید. Gemini واقعاً همه مدلهای مرزی دیگر را از بین برد. همچنین در حال حاضر تنها چتباتی است که به صورت بومی یک پیشنمایش رندر شده از کدی که تولید کرده است را به شما ارائه میدهد.




مدلهای Claude عملکرد نسبتاً خوبی داشتند. نکته جالب این است که صرف نظر از اینکه برای کدام مدل پرداخت کردهام، نتیجه چقدر کم تغییر کرده است.
اینها قیمتهایی نیستند که من از طریق اشتراکم پرداخت کردم، اما معیار مفیدی از وزن مدلها در اختیار ما قرار میدهند. Claude ۳.۵ Haiku، ارزانترین مدل در خط تولید فعلی Anthropic، نتیجهای داد که قابل تشخیص از خروجی ۱۵ دلاری به ازای هر میلیون توکن Opus نبود.
من نتوانستم مدل بسیار گرانقیمت Fable ۵ را آزمایش کنم زیرا قبلاً محدودیت استفاده روزانه خود را در OpenRouter تمام کرده بودم.
مدلهای محلی آنقدرها هم عقب نیستند
در واقع، من آنها را بیشتر دوست دارم






Gemini مطمئناً چشمگیرترین نتیجه را در میان مدلهای مرزی ایجاد کرد، اما مدلهای محلی با کسر کوچکی از توان محاسباتی نتایج قانعکنندهای ایجاد کردند.



در میان مدلهای محلی، بهترین نتیجه را از Qwen3.۶-27B گرفتم. من یک نسخه کوانتیزه شده Q4 را اجرا کردم که فقط به ۱۶ گیگابایت VRAM روی پردازنده گرافیکی ثانویه ۴۰۷۰ Ti Super من نیاز داشت. نتیجه کاملاً قابل تشخیص، دارای جزئیات و حتی دارای سایه بود.
Ornith 35B Q4 نیز کار بزرگی هم با دوچرخه و هم با پلیکان انجام داد. مدل ریاضی را کمی به هم ریخت و زین دوچرخه را در فضای خالی شناور رها کرد، اما پرنده بسیار چشمگیرتر از چیزی بود که Claude تولید کرد.




برای مقایسه، من همچنین تست را با Gemma ۴ E2B اجرا کردم. این یکی از کوچکترین مدلهای موجود در لیست است که به قدری سبک است که میتوان آن را روی یک گوشی هوشمند اجرا کرد. در ابتدا از تولید تصویر خودداری کرد و ادعا کرد که فقط میتواند خروجی متنی تولید کند، اما زمانی که پرامپت را تغییر دادم تا «فقط کد SVG خام را بدون هیچ متن یا توضیحی برگرداند»، با این شاهکار موافقت کرد.
این امتناع اولیه خود یک نتیجه است. مدل توانایی فنی برای تولید تصویر را داشت، اما با قوانینی هماهنگ شده بود که به آن میگفت این کار را انجام ندهد.


نتیجه GLM-۴.۷-Flash عالی نبود، اما هنوز هم چشمگیر بود با توجه به اینکه این کد را با سرعتی بیش از ۱۰۰ توکن در ثانیه روی کارت گرافیک قدیمی ۳۰۶۰ من تولید کرد.
ناامیدکنندهترین نتیجه محلی مربوط به North-Mini-Code-۱.۰ بود. فایل SVG آن خالی بود. پس از سه بار تلاش، همچنان کد XML نامعتبر حاوی تگهای باز و بدون شکل تولید میکرد.
مدلهای محلی در حین استفاده از آنها هزینه توکنِ در حال افزایش ندارند، اگرچه صورتحساب برق من چیز دیگری میگوید. اگر هزینه خرید کارت گرافیک ۴۰۷۰ Ti Super و ۳۰۶۰ را با هم جمع کنید، به مرز ۱۵۰۰ دلار نزدیک میشود. اما من همچنان هزینه اولیه را به استفاده از API و اشتراکها ترجیح میدهم.
به نظر نمیرسد این بنچمارک هنوز دستکاری شده باشد
اما احتمالاً در آینده خواهد شد

قانون گودهارت (Goodhart’s Law) بیان میکند که وقتی یک معیار تبدیل به هدف میشود، دیگر معیار خوبی نیست. این دقیقاً همان اتفاقی است که برای بنچمارکهای هوش مصنوعی میافتد.
هنگامی که ارائهدهندگان مدل بدانند کدام بنچمارکها اهمیت دارند، میتوانند مدلهای خود را برای آنها بهینهسازی کنند. این کار لزوماً عمدی یا مخرب نیست. اگر مدلی روی مجموعه دادهای که شامل مجموعه سؤالات یک بنچمارک است آموزش داده شود، در آن تست استثنایی عمل خواهد کرد.
ممکن است مدل به دلیل مواجهه با مشکل مشابه عملکرد خوبی داشته باشد، یا صرفاً به این دلیل که حفظ کرده است گزینه C پاسخ صحیح به سؤال ۴ است.
ما قبلاً دیدهایم که بنچمارکهای اصلی ارزش خود را به این طریق از دست دادهاند. در فوریه ۲۰۲۶، Scale AI بنچمارک GSM8k را که استاندارد صنعتی برای ارزیابی قابلیتهای ریاضی بود، منسوخ اعلام کرد. دلیل این امر این بود که مدلها به قدری در آن مهارت پیدا کرده بودند که دیگر هیچ قدرت پیشبینیکنندهای نداشت.
بنچمارکها از نظر تجاری نیز اهمیت دارند. شرکتهای OpenAI و Anthropic در حال آماده شدن برای عرضه اولیه عمومی (IPO) در سالهای آینده هستند. آنها باید به سرمایهگذاران نشان دهند که محصولاتشان پیشرو در صنعت است.
هنگامی که شرکتی مدل جدیدی را راهاندازی میکند و ارائه خود را با نمودارهایی پر میکند که نشان میدهد مدل جدید در تمام بنچمارکهای کلیدی برتری دارد، این دادهها اکنون ارزش میلیاردها دلار دارند. انگیزه بهینهسازی برای بنچمارکها بسیار زیاد است.
تست پلیکان تا به امروز مفید باقی مانده است زیرا، تا آنجا که میدانیم، ارائهدهندگان مدلهای خود را به طور خاص برای رسم پلیکانهای سوار بر دوچرخه در فرمت SVG بهینه نکردهاند.
با این حال، تنها چیزی که لازم است این است که تست پلیکان به اندازه کافی مهم شود، و به طور ناگهانی متوجه خواهیم شد که مجموعه دادههای آموزشی در حال پر شدن از آموزشهای هنری وکتور برای پرندگان دوچرخهسوار هستند.
در آن زمان، ما مجبور خواهیم شد پرامپت را تغییر دهیم. شاید یک فلامینگو روی یک تکچرخ، یا یک کرگدن که در حال اسنوبوردسواری است.
منبع: این مطلب یک بومیسازی و بازنویسی تحریریهای بر اساس مقالهای از MakeUseOf نوشته Amir Bohlooli است: مشاهده مقاله اصلی.