از آن زمان که دستیار صوتی هوش مصنوعی خودم را برای کنترل خانه هوشمند ساختم، همیشه به دنبال مدلهای بهتری بودهام که بتوانم بهصورت محلی اجرا کنم. مدلهای زبانی محلی قدرتمندی کم نیستند، ولی مگر آنکه یک سرور تقریباً سازمانی rack شده در خانهتان پنهان کرده باشید، به احتمال زیاد باید به چیزی بسنده کنید که به اندازه نسخههای ابری همکارش هوشمند نیست.
اما اوریث ۹ب چیز دیگری از آب درآمد. شاید کوچکترین مدل در خانواده Ornith ۱.۰ از DeepReinforce باشد، ولی این مدل به لپتاپ من پاسخهایی تقریباً در سطح ۳۵ب داد و از چندرسانهای هم پشتیبانی میکند.
مدلی کوچک با جاهطلبیهای بزرگ
اوریث ۹ب از وزن خود فراتر میزند





همانطور که پیشتر گفته شد، اوریث ۹ب کوچکترین عضو خانواده مدلهای Ornith ۱.۰ است که شامل مدلهای چگال ۳۱ب، ۳۵ب mixture-of-experts و نسخه عظیم ۳۹۷ب mixture-of-experts هم میشود. چیزی که کل این خانواده را متمایز میکند، روش یادگیری تقویتی خودبهبودی است که روی پایه Qwen ۳.۵ آموزش پسین گرفته و در آن مدل میآموزد به جای اتکا به حلقه ثابت عاملیِ انساننوشته، داربست حل مسئله خود را بسازد و اصلاح کند. این فلسفه آموزش، نه تعداد خام پارامترها، دلیل واقعی است که این مدل ۹ب از طبقه وزنی خود فراتر میزند.
با دقت کامل bf16، اوریث ۹ب به حدود ۱۹ گیگابایت حافظه نیاز دارد؛ به همین دلیل DeepReinforce یک GPU با ۸۰ گیگابایت را برای اجرای کوانتیزهنشده توصیه میکند. نسخههای GGUF کوانتیزهشده این آزمایش را ممکن کردند و همان تغییر یعنی دیگر برای اجرای مدلهای هوش مصنوعی محلی به GPU قدرتمندی نیاز ندارید. در کوانتیزاسیون Q4_K_M حجم مدل به تقریباً ۵٫۶ گیگابایت میرسد و پس از کنار گذاشتن فضای کافی برای سیستمعامل و یک پنجره زمینه معقول، راحت در بودجه ۱۶ گیگابایتی RAM جا میگیرد.

اما آن رقم ۱۶ گیگابایت RAM سیستم است، نه حافظه یکپارچهای که GPU مکهای اپل سیلیکون میتواند مستقیماً از آن استفاده کند. لپتاپ من آن RAM را با یک GPU انویدیا RTX ۴۰۶۰ با ۸ گیگابایت VRAM جفت کرده است و انتخاب اول مدل زبانی محلی دقیقاً به همین برمیگردد: روی GPU اختصاصی، VRAM سرعت را تعیین میکند، نه RAM کل.
اگر VRAM کمتری داشته باشید، نسخه ۵٫۶ گیگابایتی کوانتیزه جا نمیشود؛ پس Ollama بخشی از آن را به CPU منتقل میکند و کندتر از آنچه GPU میتواند پردازش کند اجرا میشود. این یکی از دلایلی است که مکها برای اجرای مدلهای هوش مصنوعی محلی بهترند، چون حافظه و GPU آن ماشین یک مخزن مشترک دارند. باز هم روی لپتاپهای قدیمیتر جا میگیرد (و روی مدلهای جدیدتر بهتر)، ولی جا شدن در RAM و اجرا روی GPU دو چیز متفاوتاند.
چرا همه میگویند «در سطح ۳۵ب»
عملکرد با مدلهای بسیار بزرگتر برابر میشود

اوریث ۹ب میتواند سر به سر با مدلهای بسیار بزرگتر از خود، از جمله Gemma ۴-31B و Qwen ۳.۶-35B رقابت کند. با این حال، نسخه ۳۵ب mixture-of-experts خواهر خودش در همان بنچمارکها فاصله معناداری میگیرد.
در بنچمارک SWE-bench Verified اوریث ۹ب نمره ۶۹٫۴ درصد میگیرد. در Terminal-Bench ۲.۱ نمره ۴۳٫۱ ثبت میکند؛ نتیجهای قوی برای مدلی که یکسوم تا یکچهارم اندازه همتایانی که شکست میدهد. مدلی با ۹ میلیارد پارامتر که به نتایج مورد انتظار از سیستمهای کلاس ۳۱ب میرسد، برای خودش رقیبی واقعاً قدرتمند است.
تصاویر را هم میفهمد
پشتیبانی تصویر آن را مفیدتر میکند

بله، اوریث ۹ب میتواند تصاویر را بخواند، ولی با یک ستاره همراه است. کارت مدل پایه Ornith-۱.۰-9B متن را بهعنوان مدالیته اصلی فهرست کرده است؛ پس اگر نسخه پیشفرض GGUF یا وزنهای استاندارد Hugging Face را بگیرید، پشتیبانی تصویر خارج از جعبه نخواهید داشت. پشتیبانی تصویر از یک خروجی جداگانه میآید که با یک تگ انجمنی در Ollama توزیع شده، robit/ornith-vision:9b، نه یک نسخه رسمی DeepReinforce، و قابلیت تصویر و فراخوانی ابزار را روی همان ستون فقرات استدلالی مینشاند.
امروزه Ollama و LM Studio هر دو مدلهای چندوجهی را روانتر مدیریت میکنند؛ به همین دلیل میتوانید پرداخت برای ChatGPT را متوقف کنید و یک سامانه هوش مصنوعی خصوصی بسازید که بدون دردسر زیاد تصاویر را هم پردازش کند. حداقل یک نسخه MLX کوانتیزهشده هم متن و تصویر را بهعنوان مدالیتهای پشتیبانیشده مستقیماً در کارت مدل فهرست کرده و تأیید میکند که پشتیبانی چندوجهی افزودنی است که روی نسخههای خاص اعمال میشود، نه جهانی در همه فایلهای اوریث ۹ب. اگر дома همراه ما پیش میروید، نسخه دارای تگ تصویر را از فضای نام واقعیاش بکشید، نه اولین نسخه کوانتیزه اوریث ۹بی که پیدا میکنید.
بینقص نیست
استدلال پیچیده هنوز محدودیتهایش را آشکار میکند

هیچ مدل کوچکی ستونشکن بینقص نیست و اورنیث ۹بی هم از این قاعده مستثنی نیست. نگارش ۹بی میتواند در کارهای عاملیانهی طولانی و چندمرحلهای وارد حلقه شود یا متوقف گردد، بهگونهای که خواهرهای بزرگترش با اقتدار بیشتری آنها را مدیریت میکنند، که با بودجهی پارامتری کوچکتر در فشارهای پایدار همخوانی دارد.
روی سختافزار من، این دست و پنجه نرمی زودتر خود را نشان میدهد، چون بخشی از مدل روی پردازنده اجرا میشود. انویدیا دیگر تنها گزینه برای مدلهای زبانی محلی نیست، اما هر کارت گرافیکی با تنها چند گیگابایت حافظهی ویدیویی، برندش هرچه که باشد به همین سقف برمیخورد. این هشدار سودمند را در نظر داشته باشید اگر انتظار سازگاری در سطح ۳۵بی را همهجا دارید، زیرا دستاوردها روی کارهای مشخص کدنویسی و ترمینال متمرکز میشوند، نه استدلال همهمنظوره.
یک هوش مصنوعی محلی که شایستهی توجه است
مدل ۳۵بی نیست، اما شگفتآور به آن نزدیک میشود
هیچکدام از اینها نیاز به بزرگنمایی نداشت. اورنیث ۹بی مدلی با نه میلیاردها پارامتر است که در معیارهای واقعی کدنویسی سیستمی سه برابر خود را شکست میدهد، روی سختافزاری اجرا میشود که بیشتر راهنماهای هوش مصنوعی محلی آن را قدیمی میخوانند، و با دانستن اینکه کدام نگارش را تهیه کنید، تصاویر را نیز میخواند.
این مدلی است که برای کار مشخصی ساخته شده — کدنویسی عاملیانه — و دقیقاً همانجا از رقبا سبقت میگیرد. تا زمانی که به اندازهی کافی حافظهی ویدیویی برای اجرایش دارید (یا اگر ندارید، انتظاراتتان را مدیریت میکنید)، با سرعت در کارهای کدنویسی بهصورت آفلاین پیش خواهید رفت.
منبع: این مطلب ترجمه و بومیسازی مقالهای از MakeUseOf به قلم Yadullah Abidi است. مشاهده مقاله اصلی