خبر و ترفند روز

خبر و ترفند های روز را اینجا بخوانید!

NVIDIA دیگر تنها انتخاب برای اجرای محلی LLMها نیست؛ تست AMD من این را ثابت می‌کند

آزمون AMD مقابل NVIDIA برای اجرای محلی مدل‌های زبانی بزرگ روی ROG Flow Z13
NVIDIA همیشه بهترین انتخاب برای LLMهای محلی بوده، اما AMD با ROCm و Vulkan به رقابت پیوسته و ارزش بیشتری ارائه می‌دهد.

سال‌هاست که AMD در اکثر بارهای کاری وابسته به هوش مصنوعی از NVIDIA عقب مانده بود. NVIDIA تقریباً همیشه انتخاب پرسرعت‌تری بوده، حتی اگر این امر با پرداخت هزینه‌ای بیشتر همراه بود — چیزی که هنوز تا حدی صادق است.

خوشبختانه، به‌نظر می‌رسد AMD (تا حد زیادی) به NVIDIA رسیده است و مجموعه نرم‌افزاری Radeon Open Compute (ROCm) آن‌ها تجربه‌ای شگفت‌آور دلپذیر روی لینوکس ارائه می‌دهد.

انتشار سخت‌افزارهای اخیری مانند سری Ryzen AI نیز کمک کرد، و برای آزمایش این موضوع، ROG Flow Z13 مورد اعتمادم را بیرون آوردم — که دارای ۳۲ گیگابایت حافظه اشتراکی و تراشه AMD Ryzen AI Max ۳۹۰ است. این هم موهبت است و هم نقص، زیرا AI Max آن حافظه مشترک را برای هم VRAM و هم RAM سیستم استفاده می‌کند که کار را کمی پیچیده می‌کند.

رابط کاربری Claude Cowork و Hermes روی دسکتاپ

راه‌اندازی همه چیز روی Arch Linux

نگاهی به سیستم آزمایش

نصب Ollama روی Arch Linux بسیار ساده بود. تنها کاری که باید روی سیستمم انجام می‌دادم این بود که یک ترمینال باز کنم و آخرین نسخه AUR را با Pacman دانلود کنم.

از آنجا که این یک سیستم کاملاً AMD بود، باید بسته‌ها را با دقت انتخاب می‌کردم. دو بسته‌ای که انتخاب کردم ollama-vulkan و ollama-rocm بودند، و سپس

sudo pacman -S ollama ollama-vulkan ollama-rocm rocm-hip-sdk rocm-opencl-sdk 
sudo systemctl enable --now ollama
دیمن سرویس را در سطح سیستم فعال کردم.

همچنین می‌توان Ollama را با اسکریپت نصب وب کاملاً نصب کرد، اما عمداً این کار را نکردم. دلیل آن این بود که به‌روزرسانی‌های متمرکز را انتخاب کنم، به جای اینکه برای به‌روزرسانی‌ها جداگانه به Ollama تکیه کنم.

مطلب مرتبط:   آیا می دانید می توانید این 10 لوازم جانبی را به درگاه USB خودرو وصل کنید؟

با راه‌اندازی Ollama، بالاخره زمان استقرار چند مدل فرا رسید:

  • gemma2:9b
  • mistral:7b
  • phi4:14b
  • deepseek-r1:8b
  • deepseek-r1:14b
  • llava:7b
  • llava:13b

همچنین باید محدودیت‌های سخت‌افزاری را در نظر بگیریم. مدل خاص Flow Z13 من از تراشه کم‌توان‌تر AI Max ۳۹۰ با iGPU Radeon 8050S استفاده می‌کند که ۸ CU کمتر از پرچمدار 8060S دارد.

این سیستم تنها ۳۲ گیگابایت حافظه اشتراکی بین سیستم و iGPU دارد که تعداد مدل‌هایی که می‌توانیم اجرا کنیم را محدود می‌کند. با این حال، می‌توان تا ۲۴ گیگابایت VRAM را از داخل BIOS تخصیص داد که باید با اکثر GPUهای مصرفی رده‌بالا برابر باشد.

با این حال، این تنها نیمی از ماجرا است — همچنان باید پهنای باند حافظه را در نظر بگیریم که برای AI Max تقریباً ۲۵۶ گیگابایت بر ثانیه است. این را با RX ۹۰۷۰ (۶۴۰ گیگابایت بر ثانیه) مقایسه کنید که یکی از بهترین پیشنهادات AMD است، و کاملاً واضح است که این ممکن است در نگاه اول چندان چشمگیر نباشد.

اجرای بنچمارک‌ها

نتایج شگفت‌انگیزی برای ROCm در برابر Vulkan

دست در حال نگه‌داشتن یک کارت گرافیک AMD

برای بنچمارک، از مجموعه llm-benchmark استفاده کردم

sudo pacman -S python-pip python-pipx
pipx install llm-benchmark
llm_benchmark run
که به‌طور خودکار وابستگی‌های لازم را دانلود می‌کند.

با جابه‌جایی بین بک‌اندهای Vulkan و ROCm، مجموعه‌ای از بنچمارک‌ها را اجرا کردم که تکمیل آن‌ها مدتی طول کشید. ماشین بیکران محدود مطلق خود رسید، با حداکثر TDP.

بنچمارک ROCm در برابر Vulkan برای Radeon 8050S

از نمودارها، بسیار شگفت‌انگیز بود که ROCm و Vulkan از نظر عملکرد چقدر به هم نزدیک بودند. برای بیشتر بخش‌ها، آن‌ها عمدتاً یکسان عمل کردند. با این حال، خطاهای out of memory را روی ROCm زیاد تجربه کردم. بنابراین، در حال حاضر برای توصیه ROCm تردید دارم — برای تجربه پایدارتر به Vulkan پایبند باشید.

مطلب مرتبط:   پیام‌رسانی فوری موبایل چگونه پیام‌رسانی فوری و MMS را به وجود آورد
مقایسه Radeon 8050S با RTX 4060 موبایل برای بارهای کاری هوش مصنوعی

Radeon 8050S با ۳۲ CU به دلیل اندازه کوچک و TDP پایین‌ترش به‌شکل تحسین‌برانگیزی عمل می‌کند و به Nvidia RTX ۴۰۶۰ Mobile نزدیک می‌شود که یک GPU میان‌رده بسیار پرتوان‌تر است. در حالی که RTX ۴۰۶۰ Mobile توان بیشتری دارد، به دلیل تنها ۸ گیگابایت VRAM محدود، بی‌شک به گلوگاه می‌رسد.

مقایسه Radeon 8050S با RX 9070 XT برای بارهای کاری هوش مصنوعی محلی

Strix Halo، در مقابل، به کل ۳۲ گیگابایت RAM دسترسی دارد که آن را به انتخابی بدیهی برای LLMهای سنگین‌تر تبدیل می‌کند. این الگویی است که با AMD به آن عادت خواهید کرد.

یک RX ۹۰۷۰ XT دسکتاپ، از طرف دیگر، بهترین مورد استفاده را با ۹۵ توکن بر ثانیه روی مدل‌های 7B دارد که تقریباً ۲ برابر ارتقا نسبت به 8050S است. همچنین ارزش بسیار بهتری در مقابل قیمت و پهنای باند حافظه دارد که آن را به انتخابی آسان برای اکثر افراد تبدیل می‌کند.

با این حال، در مقایسه با RTX ۵۰۹۰ NVIDIA، تمام پیشنهادهای AMD به‌شکلی خنده‌دار از انتظارات کوتاه می‌آیند. ۵۰۹۰ کارت بهتری برای هوش مصنوعی محلی است، اما برای اکثر افراد به‌شکلی غیرمعقول گران است. AMD انتخاب منطقی‌تری است که اتفاقاً بار مالی کمی روی کیف پول شما می‌گذارد و عملکرد رقابتی در برابر قیمت خود ارائه می‌دهد.

عملکرد کاملاً خوب است، اما ارزش جایی است که AMD واقعاً می‌درخشد

در حالی که نمی‌توانم منکر شوم که NVIDIA در حال حاضر بهترین مطلق را برای LLMها ارائه می‌دهد، AMD در سال‌های اخیر خوب عمل کرده تا برسد. هم ROCm و هم Vulkan بهبودهای قابل‌توجهی داشته‌اند، و AMD اکنون جایگزینی شگفت‌انگیز رقابتی است.

دلیل زیادی برای پرداخت هزینه اضافه برای کارت NVIDIA وجود ندارد — به‌خصوص وقتی در نظر بگیریم که آن‌ها معمولاً از نظر VRAM چقدر محدود می‌شوند.

مطلب مرتبط:   7 ویژگی هیجان انگیز هوش مصنوعی Bard در Google I/O 2023 معرفی شد
تصویر برچسب ASUS ROG Flow Z13

منبع: این مطلب یک بومی‌سازی و بازنویسی تحریریه‌ای بر اساس مقاله‌ای از MakeUseOf نوشته Dipan Saha است: مشاهده مقاله اصلی.