از زمانی که دستیار صوتی هوش مصنوعی خودم را برای کنترل خانه هوشمند ساختهام، همیشه به دنبال مدلهای بهتری بودهام که بتوانم بهصورت محلی اجرا کنم. مدلهای زبانی محلی قدرتمند کم نیستند، اما مگر آنکه سروری تقریباً سازمانی را در خانهتان پنهان کرده باشید، احتمالاً باید به مدلی بسنده کنید که به اندازه همتایان ابریاش هوشمند نیست.
اما اورنیث ۹ب متفاوت از آب درآمد. شاید کوچکترین مدل خانواده Ornith ۱.۰ از DeepReinforce باشد، اما روی لپتاپ من پاسخهایی تقریباً همسطح مدلهای ۳۵ب ارائه داد و از ورودیهای چندرسانهای نیز پشتیبانی میکند.
مدلی کوچک با جاهطلبیهای بزرگ
اورنیث ۹ب فراتر از وزن خود ظاهر میشود





همانطور که پیشتر گفته شد، اورنیث ۹ب کوچکترین عضو خانواده مدلهای Ornith ۱.۰ است؛ خانوادهای که مدلهای چگال ۳۱ب، ۳۵ب با معماری mixture-of-experts و نسخه عظیم ۳۹۷ب با معماری mixture-of-experts را نیز در بر میگیرد. آنچه این خانواده را متمایز میکند، روش یادگیری تقویتی خودبهبودی آن است که بر پایه Qwen ۳.۵ پسآموزش دیده است. در این روش، مدل بهجای تکیه بر حلقه عاملی ثابت و انساننوشته، میآموزد داربست حل مسئله خود را بسازد و اصلاح کند. این فلسفه آموزشی، نه صرفاً تعداد پارامترها، علت اصلی عملکرد فراتر از رده وزنی این مدل ۹ب است.
اورنیث ۹ب با دقت کامل bf16 به حدود ۱۹ گیگابایت حافظه نیاز دارد؛ به همین دلیل DeepReinforce برای اجرای نسخه کوانتیزهنشده، GPU با ۸۰ گیگابایت حافظه را توصیه میکند. نسخههای GGUF کوانتیزهشده اجرای این آزمایش را ممکن کردند؛ تغییری که یعنی برای اجرای مدلهای هوش مصنوعی محلی، دیگر الزاماً به GPU بسیار قدرتمند نیاز ندارید. در کوانتیزاسیون Q4_K_M، حجم مدل به حدود ۵٫۶ گیگابایت میرسد و پس از کنار گذاشتن فضای کافی برای سیستمعامل و پنجره زمینهای معقول، بهراحتی در بودجه ۱۶ گیگابایتی RAM جا میگیرد.

اما آن رقم، ۱۶ گیگابایت RAM سیستم است؛ نه حافظه یکپارچهای که GPU در مکهای اپل سیلیکون میتواند مستقیماً از آن بهره ببرد. لپتاپ من این RAM را با یک GPU انویدیا RTX ۴۰۶۰ با ۸ گیگابایت VRAM جفت کرده است و انتخاب نخست مدل زبانی محلی دقیقاً به همین موضوع برمیگردد: در GPU اختصاصی، VRAM سرعت را تعیین میکند، نه مجموع RAM سیستم.
اگر VRAM کمتری داشته باشید، نسخه کوانتیزهشده ۵٫۶ گیگابایتی بهطور کامل جا نمیگیرد؛ در نتیجه Ollama بخشی از آن را به CPU منتقل میکند و مدل کندتر از توان واقعی GPU اجرا میشود. این یکی از دلایلی است که مکها برای اجرای مدلهای هوش مصنوعی محلی مناسبترند، زیرا حافظه و GPU در آنها از یک مخزن مشترک استفاده میکنند. مدل همچنان روی لپتاپهای قدیمیتر جا میگیرد و روی مدلهای جدیدتر بهتر عمل میکند، اما جا شدن در RAM با اجرا شدن روی GPU یکسان نیست.
چرا همه میگویند «در سطح ۳۵ب»
عملکردی همسطح مدلهای بسیار بزرگتر

اورنیث ۹ب میتواند با مدلهایی بسیار بزرگتر از خود، از جمله Gemma ۴-31B و Qwen ۳.۶-35B، رقابت کند. با این حال، نسخه ۳۵ب با معماری mixture-of-experts از همین خانواده، در همان بنچمارکها با فاصلهای معنادار پیشتاز است.
اورنیث ۹ب در بنچمارک SWE-bench Verified امتیاز ۶۹٫۴ درصد میگیرد. در Terminal-Bench ۲.۱ نیز امتیاز ۴۳٫۱ ثبت میکند؛ نتیجهای قدرتمند برای مدلی که تنها یکسوم تا یکچهارم اندازه همتایانی است که پشت سر میگذارد. مدلی با ۹ میلیارد پارامتر که به نتایج مورد انتظار از سیستمهای رده ۳۱ب میرسد، بیتردید رقیبی بسیار توانمند است.
تصاویر را هم میفهمد
پشتیبانی از تصویر، کاربرد آن را بیشتر میکند

بله، اورنیث ۹ب میتواند تصاویر را بخواند، اما یک نکته مهم وجود دارد. در کارت مدل پایه Ornith-۱.۰-9B، متن بهعنوان مدالیته اصلی فهرست شده است؛ بنابراین اگر نسخه پیشفرض GGUF یا وزنهای استاندارد Hugging Face را دریافت کنید، پشتیبانی تصویر را بهصورت آماده نخواهید داشت. پشتیبانی تصویر از خروجی جداگانهای میآید که با یک تگ انجمنی در Ollama منتشر شده است: robit/ornith-vision:9b. این نسخه رسمی DeepReinforce نیست و قابلیت تصویر و فراخوانی ابزار را بر همان ستون فقرات استدلالی افزوده است.
امروزه Ollama و LM Studio هر دو مدلهای چندوجهی را روانتر مدیریت میکنند؛ بنابراین میتوانید پرداخت برای ChatGPT را متوقف کنید و سامانهای خصوصی بسازید که بدون دردسر زیاد، تصاویر را نیز پردازش کند. دستکم یک نسخه MLX کوانتیزهشده، متن و تصویر را مستقیماً بهعنوان مدالیتههای پشتیبانیشده در کارت مدل فهرست کرده است و تأیید میکند که پشتیبانی چندوجهی افزونهای برای نسخههای مشخص است، نه قابلیتی همگانی در تمام فایلهای اورنیث ۹ب. اگر در خانه همراه ما پیش میروید، نسخه دارای تگ تصویر را از فضای نام اصلی آن دریافت کنید، نه نخستین نسخه کوانتیزه اورنیث ۹ب که پیدا میکنید.
بینقص نیست
استدلال پیچیده هنوز محدودیتهایش را آشکار میکند

هیچ مدل کوچکی بینقص نیست و اورنیث ۹ب نیز از این قاعده مستثنی نیست. نسخه ۹ب ممکن است در کارهای عاملیانه طولانی و چندمرحلهای وارد حلقه شود یا متوقف بماند؛ کارهایی که مدلهای بزرگتر این خانواده با اطمینان بیشتری مدیریت میکنند. این رفتار با محدودیت بودجه پارامتری کمتر، بهویژه زیر بارهای پایدار، همخوانی دارد.
روی سختافزار من، این کشمکش زودتر خود را نشان میدهد، زیرا بخشی از مدل روی پردازنده اجرا میشود. انویدیا دیگر تنها گزینه برای مدلهای زبانی محلی نیست، اما هر کارت گرافیکی با تنها چند گیگابایت حافظه ویدیویی، فارغ از برند، به همین سقف میرسد. اگر انتظار عملکردی همسطح مدلهای ۳۵ب را در همه شرایط دارید، این هشدار را در نظر داشته باشید؛ زیرا دستاوردها بر وظایف مشخص کدنویسی و ترمینال متمرکزند، نه استدلال همهمنظوره.
یک هوش مصنوعی محلی که شایسته توجه است
مدل ۳۵ب نیست، اما شگفتآور به آن نزدیک میشود
هیچیک از این موارد به بزرگنمایی نیاز ندارد. اورنیث ۹ب مدلی با ۹ میلیارد پارامتر است که در معیارهای واقعی کدنویسی سیستمی، مدلهایی تا سه برابر بزرگتر از خود را پشت سر میگذارد؛ روی سختافزاری اجرا میشود که بسیاری از راهنماهای هوش مصنوعی محلی آن را قدیمی میدانند و، اگر نسخه مناسب را انتخاب کنید، تصاویر را نیز میخواند.
این مدل برای کاری مشخص ساخته شده است: کدنویسی عاملیانه. دقیقاً در همین حوزه نیز از رقبا پیشی میگیرد. تا زمانی که VRAM کافی برای اجرای آن دارید، یا در صورت نداشتن آن انتظاراتتان را تنظیم میکنید، میتوانید کارهای کدنویسی را بهصورت آفلاین و با سرعت انجام دهید.
منبع: این مطلب ترجمه و بومیسازی مقالهای از MakeUseOf به قلم Yadullah Abidi است. مشاهده مقاله اصلی