خبر و ترفند روز

خبر و ترفند های روز را اینجا بخوانید!

اوریث ۹ب به لپ‌تاپ ۱۶ گیگابایتی من پاسخ‌هایی در سطح ۳۵ب داد و تصاویر را هم می‌خواند

اورنیث ۹بی به لپ‌تاپ ۱۶ گیگابایتی من پاسخ‌هایی نزدیک به سطح ۳۵بی داد و تصاویر را هم می‌خواند
لپ‌تاپم فکر می‌کند دارد یک مدل ۳۵ب اجرا می‌کند.

از زمانی که دستیار صوتی هوش مصنوعی خودم را برای کنترل خانه هوشمند ساخته‌ام، همیشه به دنبال مدل‌های بهتری بوده‌ام که بتوانم به‌صورت محلی اجرا کنم. مدل‌های زبانی محلی قدرتمند کم نیستند، اما مگر آنکه سروری تقریباً سازمانی را در خانه‌تان پنهان کرده باشید، احتمالاً باید به مدلی بسنده کنید که به اندازه همتایان ابری‌اش هوشمند نیست.

اما اورنیث ۹ب متفاوت از آب درآمد. شاید کوچک‌ترین مدل خانواده Ornith ۱.۰ از DeepReinforce باشد، اما روی لپ‌تاپ من پاسخ‌هایی تقریباً هم‌سطح مدل‌های ۳۵ب ارائه داد و از ورودی‌های چندرسانه‌ای نیز پشتیبانی می‌کند.

مدلی کوچک با جاه‌طلبی‌های بزرگ

اورنیث ۹ب فراتر از وزن خود ظاهر می‌شود

همان‌طور که پیش‌تر گفته شد، اورنیث ۹ب کوچک‌ترین عضو خانواده مدل‌های Ornith ۱.۰ است؛ خانواده‌ای که مدل‌های چگال ۳۱ب، ۳۵ب با معماری mixture-of-experts و نسخه عظیم ۳۹۷ب با معماری mixture-of-experts را نیز در بر می‌گیرد. آنچه این خانواده را متمایز می‌کند، روش یادگیری تقویتی خودبهبودی آن است که بر پایه Qwen ۳.۵ پس‌آموزش دیده است. در این روش، مدل به‌جای تکیه بر حلقه عاملی ثابت و انسان‌نوشته، می‌آموزد داربست حل مسئله خود را بسازد و اصلاح کند. این فلسفه آموزشی، نه صرفاً تعداد پارامترها، علت اصلی عملکرد فراتر از رده وزنی این مدل ۹ب است.

اورنیث ۹ب با دقت کامل bf16 به حدود ۱۹ گیگابایت حافظه نیاز دارد؛ به همین دلیل DeepReinforce برای اجرای نسخه کوانتیزه‌نشده، GPU با ۸۰ گیگابایت حافظه را توصیه می‌کند. نسخه‌های GGUF کوانتیزه‌شده اجرای این آزمایش را ممکن کردند؛ تغییری که یعنی برای اجرای مدل‌های هوش مصنوعی محلی، دیگر الزاماً به GPU بسیار قدرتمند نیاز ندارید. در کوانتیزاسیون Q4_K_M، حجم مدل به حدود ۵٫۶ گیگابایت می‌رسد و پس از کنار گذاشتن فضای کافی برای سیستم‌عامل و پنجره زمینه‌ای معقول، به‌راحتی در بودجه ۱۶ گیگابایتی RAM جا می‌گیرد.

مطلب مرتبط:   7 راه برای رفع اکسل باز کردن یک سند خالی
جاگیری اورنیث ۹بی در حافظه‌ی ویدیویی VRAM

اما آن رقم، ۱۶ گیگابایت RAM سیستم است؛ نه حافظه یکپارچه‌ای که GPU در مک‌های اپل سیلیکون می‌تواند مستقیماً از آن بهره ببرد. لپ‌تاپ من این RAM را با یک GPU انویدیا RTX ۴۰۶۰ با ۸ گیگابایت VRAM جفت کرده است و انتخاب نخست مدل زبانی محلی دقیقاً به همین موضوع برمی‌گردد: در GPU اختصاصی، VRAM سرعت را تعیین می‌کند، نه مجموع RAM سیستم.

اگر VRAM کمتری داشته باشید، نسخه کوانتیزه‌شده ۵٫۶ گیگابایتی به‌طور کامل جا نمی‌گیرد؛ در نتیجه Ollama بخشی از آن را به CPU منتقل می‌کند و مدل کندتر از توان واقعی GPU اجرا می‌شود. این یکی از دلایلی است که مک‌ها برای اجرای مدل‌های هوش مصنوعی محلی مناسب‌ترند، زیرا حافظه و GPU در آن‌ها از یک مخزن مشترک استفاده می‌کنند. مدل همچنان روی لپ‌تاپ‌های قدیمی‌تر جا می‌گیرد و روی مدل‌های جدیدتر بهتر عمل می‌کند، اما جا شدن در RAM با اجرا شدن روی GPU یکسان نیست.

چرا همه می‌گویند «در سطح ۳۵ب»

عملکردی هم‌سطح مدل‌های بسیار بزرگ‌تر

ارزیابی عملکرد اورنیث ۹بی در مقایسه با سایر مدل‌های زبانی

اورنیث ۹ب می‌تواند با مدل‌هایی بسیار بزرگ‌تر از خود، از جمله Gemma ۴-31B و Qwen ۳.۶-35B، رقابت کند. با این حال، نسخه ۳۵ب با معماری mixture-of-experts از همین خانواده، در همان بنچمارک‌ها با فاصله‌ای معنادار پیشتاز است.

اورنیث ۹ب در بنچمارک SWE-bench Verified امتیاز ۶۹٫۴ درصد می‌گیرد. در Terminal-Bench ۲.۱ نیز امتیاز ۴۳٫۱ ثبت می‌کند؛ نتیجه‌ای قدرتمند برای مدلی که تنها یک‌سوم تا یک‌چهارم اندازه همتایانی است که پشت سر می‌گذارد. مدلی با ۹ میلیارد پارامتر که به نتایج مورد انتظار از سیستم‌های رده ۳۱ب می‌رسد، بی‌تردید رقیبی بسیار توانمند است.

مطلب مرتبط:   می‌توانید (و باید) یک LLM کوچک را بر روی گوشی اندروید خود اجرا کنید.

تصاویر را هم می‌فهمد

پشتیبانی از تصویر، کاربرد آن را بیشتر می‌کند

آزمون بینایی اورنیث ۹بی

بله، اورنیث ۹ب می‌تواند تصاویر را بخواند، اما یک نکته مهم وجود دارد. در کارت مدل پایه Ornith-۱.۰-9B، متن به‌عنوان مدالیته اصلی فهرست شده است؛ بنابراین اگر نسخه پیش‌فرض GGUF یا وزن‌های استاندارد Hugging Face را دریافت کنید، پشتیبانی تصویر را به‌صورت آماده نخواهید داشت. پشتیبانی تصویر از خروجی جداگانه‌ای می‌آید که با یک تگ انجمنی در Ollama منتشر شده است: robit/ornith-vision:9b. این نسخه رسمی DeepReinforce نیست و قابلیت تصویر و فراخوانی ابزار را بر همان ستون فقرات استدلالی افزوده است.

امروزه Ollama و LM Studio هر دو مدل‌های چندوجهی را روان‌تر مدیریت می‌کنند؛ بنابراین می‌توانید پرداخت برای ChatGPT را متوقف کنید و سامانه‌ای خصوصی بسازید که بدون دردسر زیاد، تصاویر را نیز پردازش کند. دست‌کم یک نسخه MLX کوانتیزه‌شده، متن و تصویر را مستقیماً به‌عنوان مدالیته‌های پشتیبانی‌شده در کارت مدل فهرست کرده است و تأیید می‌کند که پشتیبانی چندوجهی افزونه‌ای برای نسخه‌های مشخص است، نه قابلیتی همگانی در تمام فایل‌های اورنیث ۹ب. اگر در خانه همراه ما پیش می‌روید، نسخه دارای تگ تصویر را از فضای نام اصلی آن دریافت کنید، نه نخستین نسخه کوانتیزه اورنیث ۹ب که پیدا می‌کنید.

بی‌نقص نیست

استدلال پیچیده هنوز محدودیت‌هایش را آشکار می‌کند

توقف و معطل‌شدن اورنیث ۹بی

هیچ مدل کوچکی بی‌نقص نیست و اورنیث ۹ب نیز از این قاعده مستثنی نیست. نسخه ۹ب ممکن است در کارهای عاملیانه طولانی و چندمرحله‌ای وارد حلقه شود یا متوقف بماند؛ کارهایی که مدل‌های بزرگ‌تر این خانواده با اطمینان بیشتری مدیریت می‌کنند. این رفتار با محدودیت بودجه پارامتری کمتر، به‌ویژه زیر بارهای پایدار، همخوانی دارد.

مطلب مرتبط:   با این برنامه‌های ضروری، یادداشت‌های PDF خود را به سرعت مرور می‌کنم.

روی سخت‌افزار من، این کشمکش زودتر خود را نشان می‌دهد، زیرا بخشی از مدل روی پردازنده اجرا می‌شود. انویدیا دیگر تنها گزینه برای مدل‌های زبانی محلی نیست، اما هر کارت گرافیکی با تنها چند گیگابایت حافظه ویدیویی، فارغ از برند، به همین سقف می‌رسد. اگر انتظار عملکردی هم‌سطح مدل‌های ۳۵ب را در همه شرایط دارید، این هشدار را در نظر داشته باشید؛ زیرا دستاوردها بر وظایف مشخص کدنویسی و ترمینال متمرکزند، نه استدلال همه‌منظوره.

یک هوش مصنوعی محلی که شایسته توجه است

مدل ۳۵ب نیست، اما شگفت‌آور به آن نزدیک می‌شود

هیچ‌یک از این موارد به بزرگ‌نمایی نیاز ندارد. اورنیث ۹ب مدلی با ۹ میلیارد پارامتر است که در معیارهای واقعی کدنویسی سیستمی، مدل‌هایی تا سه برابر بزرگ‌تر از خود را پشت سر می‌گذارد؛ روی سخت‌افزاری اجرا می‌شود که بسیاری از راهنماهای هوش مصنوعی محلی آن را قدیمی می‌دانند و، اگر نسخه مناسب را انتخاب کنید، تصاویر را نیز می‌خواند.

این مدل برای کاری مشخص ساخته شده است: کدنویسی عاملیانه. دقیقاً در همین حوزه نیز از رقبا پیشی می‌گیرد. تا زمانی که VRAM کافی برای اجرای آن دارید، یا در صورت نداشتن آن انتظاراتتان را تنظیم می‌کنید، می‌توانید کارهای کدنویسی را به‌صورت آفلاین و با سرعت انجام دهید.

منبع: این مطلب ترجمه و بومی‌سازی مقاله‌ای از MakeUseOf به قلم Yadullah Abidi است. مشاهده مقاله اصلی