خبر و ترفند روز

خبر و ترفند های روز را اینجا بخوانید!

یک مدل زبانی بزرگ را روی گوشی‌ام راه انداختم؛ این ۵ کار ثابت کرد که ارزشش را داشت

یک LLM محلی روی گوشی‌ام راه‌اندازی کردم و این ۵ کار نشان داد که ارزشش را داشت
برای هوشمند بودن، گوشی شما به اجازهٔ هیچ سروری نیاز ندارد

هرچه ابزارهای هوش مصنوعی راه خود را به میان گروه‌های گسترده‌تری از مردم باز می‌کنند، استقبال از راهکارهای آفلاینی که داده‌ها و درخواست‌ها را به سرورهای دیگران نمی‌فرستند نیز بیشتر می‌شود.

بااین‌حال، بیشتر مردم نمی‌دانند که می‌توانند مدل‌های هوش مصنوعی را به‌صورت محلی روی گوشی اندرویدی خود اجرا کنند؛ مدل‌هایی که از پس کارهای سنگینی هم برمی‌آیند.

مهم‌تر اینکه بسیاری از کارهای قابل انجام با هوش مصنوعی محلی، با درنظرگرفتن عواملی مانند حریم خصوصی و هزینه، در حالت آفلاین بهتر انجام می‌شوند. در ادامه پنج کاربرد هوش مصنوعی محلی در اندروید را مرور می‌کنیم.

گفت‌وگو و بازنویسی متن

حریم خصوصی و سرعت در برابر هم نیستند

نمای کلی آزمایشگاه اعلان در Google Edge AI Gallery
نتایج بازنویسی در آزمایشگاه اعلان Google AI
گزینه‌های بازنویسی در آزمایشگاه اعلان Google Edge Gallery
پاسخ خلاصه‌سازی در Google Edge AI Gallery
گزینه‌های پیکربندی آزمایشگاه اعلان در AI Edge Gallery

گرفتن پاسخ‌های فوری برای پرسش‌های روزمره و بازنویسی متن، دو مورد از رایج‌ترین کاربردهای چت‌بات‌های هوش مصنوعی‌اند. همین کارها را می‌توان به‌آسانی با یک برنامهٔ هوش مصنوعی محلی در اندروید انجام داد. بزرگ‌ترین مزیت چیست؟ هنگام کار با اطلاعات حساس، دیگر لازم نیست نگران حریم خصوصی باشید؛ زیرا محتوا هرگز از دستگاهتان خارج نمی‌شود. بسته به مدلی که برمی‌گزینید، پردازش نیز می‌تواند بسیار سریع باشد.

برای رسیدن به این هدف چند راه پیش رو دارید. ساده‌ترین و کارآمدترین گزینه این است که مدلی مناسب را از طریق Google AI Edge Gallery راه‌اندازی کنید و هر زمان به بازنویسی متنی یا گفت‌وگو نیاز داشتید، آن را فراخوانی کنید. در AI Edge Gallery می‌توانید از میان AI Chat برای گفت‌وگوهای چندمرحله‌ای و Prompt Lab برای بازنویسی یک‌باره یکی را برگزینید. اگر برای نوشتن به پژوهش پیشرفته‌تری نیاز دارید، پیشنهاد می‌کنم از مهارت Wikipedia در حالت Agent نیز بهره بگیرید.

البته نباید انتظار سرعتی هم‌پای ChatGPT یا Gemini را داشته باشید. بااین‌همه، وقتی با محتوای حساسی سروکار دارید که نمی‌خواهید برای آموزش مدل‌ها به کار رود، کمی شکیبایی به حفظ حریم خصوصی‌تان می‌ارزد.

درک تصاویر

هوش مصنوعی تصویری هم به سرور نیاز ندارد

نمای کلی مدل‌های موجود برای حالت پرسش از تصویر در Edge Gallery
پاسخ Edge Gallery به یک درخواست تصویری
شرح ورودی در بخش پرسش از تصویر Edge Gallery
پاسخ Edge Gallery به درخواست نگارش توضیحات جایگزین تصویر
گزینه‌های پیکربندی حالت پرسش از تصویر در Edge Gallery

تا چندی پیش، مدل‌های هوش مصنوعی قابل‌اجرا روی دستگاه تنها به کارهای متنی محدود بودند؛ اما تازه‌ترین مدل‌های Gemma گوگل این وضعیت را تغییر داده‌اند. ازآنجاکه Gemini و Google Lens برای پاسخ به هر پرسش تصویری به فضای ابری متصل می‌شوند، استفاده از سامانه‌ای آفلاین برای شناسایی اشیای درون تصویر یا توصیف آن مزایای مهمی دارد. خوشبختانه برنامهٔ AI Edge Gallery این امکان را فراهم می‌کند.

مطلب مرتبط:   نحوه استفاده از توابع AND/OR در Google Sheets

برای اجرای بخش Ask Image در برنامهٔ Edge Gallery می‌توانید یکی از چهار مدل Gemma را برگزینید؛ مدل‌هایی که بسته به توان دستگاهتان عملکردی چشمگیر ارائه می‌کنند. من این قابلیت را روی گوشی خود با ۱۶ GB رم آزمودم و فرایند بسیار روان بود. می‌توانید همان لحظه عکسی بگیرید یا تصویری را که از پیش دارید بارگذاری کنید. مدل Gemma در مجموع عملکرد خوبی دارد، هرچند گاهی دچار توهم می‌شود و اطلاعات نادرست می‌سازد.

بااین‌حال، هرگاه به شرحی گام‌به‌گام از تصویری نیاز داشته باشید که نمی‌خواهید ارائه‌دهندگان خدمات ابری به آن دسترسی پیدا کنند، قابلیت Ask Image در Edge Gallery این کار را به‌خوبی انجام می‌دهد.

پیاده‌سازی گفتار به متن

تایپ صوتی، بی‌نیاز از وای‌فای

صفحه بارگذاری رونویسی در صفحه‌کلید FUTO
رابط تایپ و ورود صوتی در صفحه‌کلید FUTO
گزینه‌های مدل زبانی در صفحه‌کلید FUTO
گزینه‌های زبان چندزبانه در صفحه‌کلید FUTO
رابط تنظیمات صفحه‌کلید FUTO
رابط ویرایشگر متن اختصاصی در صفحه‌کلید FUTO

در زمینهٔ تبدیل گفتار به متن، برنامه‌های بی‌شماری پیدا می‌شوند که هر ماه هزینهٔ گزافی می‌گیرند؛ اما بیشترشان به‌جای پردازش روی دستگاه، به پردازش ابری متکی‌اند. یعنی واژه‌هایی که بر زبان می‌آورید باید به سروری متعلق به شخص ثالث فرستاده شوند. به لطف توان روزافزون مدل‌های هوش مصنوعی محلی، اکنون می‌توانید این کار را به‌آسانی روی دستگاه خود انجام دهید؛ بنابراین برای نوشتن متنی بلند با صدا، دیگر به وای‌فای نیاز ندارید.

تازه‌ترین نسخهٔ AI Edge Gallery برای قابلیت Audio Scribe چهار مدل در اختیارتان می‌گذارد که می‌توانند محتوای ضبط‌شده یا بارگذاری‌شده را به متن تبدیل کنند. محدودیت این بخش آن است که طول هر قطعه نمی‌تواند از ۳۰ ثانیه بیشتر باشد. بااین‌حال، پیشنهاد من FUTO Keyboard است؛ صفحه‌کلیدی متن‌باز برای اندروید با امکانات فراوان که مهم‌ترینشان تایپ صوتی است. این صفحه‌کلید با بهره‌گیری از مدل‌های روی دستگاه، گفتار شما را به متن تبدیل می‌کند و متن نهایی را نیز به‌خوبی می‌پیراید.

مطلب مرتبط:   استفاده از برنامه های روزنامه نگاری را متوقف کنید - کاغذ بهتر است ، و به همین دلیل است

اصلاح خودکار و پیش‌بینی واژه‌ها روی خود دستگاه نیز از دیگر قابلیت‌های FUTO Keyboard هستند که بسیار دوستشان دارم. این صفحه‌کلید همچنین اجازه می‌دهد متن را روان و مستقیم در کادر مربوط وارد کنید، بی‌آنکه مجبور باشید مدام و با کندی میان برنامه‌ها جابه‌جا شوید.

گفت‌وگو با پرونده‌های پی‌دی‌اف

سندی که هرگز از گوشی‌تان خارج نمی‌شود

رابط آغازین برنامه Anvit
رابط پیکربندی دانلود مدل‌ها در برنامه Anvit
نمایش نتایج RAG در برنامه Anvit
نمایش گزینه بارگذاری اسناد PDF در برنامه Anvit
نمایش روند استدلال عامل‌محور در برنامه Anvit

بیشتر ما با سندهای PDF سروکار داریم که در حالت عادی حاضر نیستیم آن‌ها را در ابزارهای هوش مصنوعی بارگذاری کنیم، اما به‌خاطر راحتی این کار، سرانجام تن به آن می‌دهیم. همین نگرانی‌های مربوط به حریم خصوصی است که استفاده از ابزارهای هوش مصنوعی محلی را برای چنین کاری منطقی‌تر می‌کند. خوشبختانه چند راه برای گفت‌وگو با فایل‌های PDF وجود دارد که در آن‌ها سندها هرگز از گوشی هوشمندتان خارج نمی‌شوند. من به‌تازگی برای قابلیت‌های محلی RAG از برنامه‌ای به نام Anvit استفاده می‌کنم که یک مدل محلی Gemma را به کار می‌گیرد!

با توجه به اینکه Anvit ساخته یک توسعه‌دهنده مستقل است، امکان گفت‌وگو با سندهای PDF را به‌شکلی شگفت‌انگیز فراهم می‌کند! این فرایند چند دقیقه زمان می‌برد که دانلود مدل اصلی هوش مصنوعی و مدل مکمل RAG نیز در همین مدت انجام می‌شود. پس از پایان این مرحله، Anvit از شما می‌خواهد فایل PDF موردنظر را بارگذاری کنید تا برای RAG آماده شود. پس از آن می‌توانید به‌آسانی با محتوای همان سند PDF گفت‌وگو کنید.

همان‌طور که می‌توان حدس زد، استفاده از برنامه‌ای مانند Anvit بسیار منطقی‌تر از آن است که سندهای شرکتی یا فایل‌های کاری خود را در فضای ابری بارگذاری کنید.

اجرای یک مدل زبانی بزرگِ کامل

اعداد بنچمارک مرا قانع کردند

نمای کلی گفت‌وگوی هوش مصنوعی در گالری Edge
نمایش مدل‌های دردسترس برای گفت‌وگوی هوش مصنوعی در گالری Edge
نمایش پاسخ به درخواست گفت‌وگوی هوش مصنوعی در گالری Edge
نمایش گزینه‌های ورودی در گالری Edge
نمایش گزینه‌های پنجره کنش‌های موبایلی در گالری Edge
نمایش گزینه‌های مدل Tiny Garden در گالری Edge

در نهایت، شاید بخواهید یک مدل زبانی بزرگ و همه‌منظوره را نیز روی دستگاه خود اجرا کنید؛ چون چنین کاری کاملاً منطقی است. خوشبختانه، اگر مدل‌های مناسب را در اختیار داشته باشید، AI Edge Gallery این امکان را برایتان فراهم می‌کند. این بخش از برنامه هوش مصنوعی به شما اجازه می‌دهد چند مدل غیر Gemma، مانند Qwen ۲.۵ Instruct و DeepSeek R1 Distill، را نیز اجرا کنید. به‌این‌ترتیب، حتی بدون داشتن دستگاهی بسیار قدرتمند هم می‌توانید یک مدل زبانی بزرگِ کامل را اجرا کنید.

مطلب مرتبط:   نحوه درج تصاویر در صفحه گسترده اکسل

قابلیت گفت‌وگوی هوش مصنوعی در جایگاه یک مدل زبانی بزرگ چندوجهی عملکرد بسیار خوبی دارد و هر گفت‌وگو می‌تواند تا ۱۰ تصویر و یک قطعه صوتی 30ثانیه‌ای را پشتیبانی کند. می‌توانید درست مانند ChatGPT یا Claude با آن گفت‌وگو کنید، هرچند سرعت اجرا به دستگاه و منابع در دسترس بستگی دارد. میزان اختیاری که برنامه AI Edge Gallery در دسترس کاربر می‌گذارد نیز ستودنی است؛ زیرا می‌توانید شمار توکن‌ها، گزینه‌های شتاب‌دهنده و حتی اعلان سیستمی را تنظیم کنید.

به یاد داشته باشید که بسته به شیوه پیکربندی، برخی مدل‌ها مصرف پردازنده و حافظه رم را افزایش می‌دهند. بااین‌حال، می‌توان با این مسئله کنار آمد؛ زیرا این مدل‌ها بدون اتصال به اینترنت نیز اجرا می‌شوند.

کاستی‌های هوش مصنوعی محلی

همان‌طور که پیداست، راهکارهای هوش مصنوعی محلی برای همه دستگاه‌ها نسخه‌ای یکسان و بی‌نقص نیستند! بنابراین پیش از انتخاب مدل مناسب باید عواملی مانند حافظه رم، فضای ذخیره‌سازی و سرعت پردازش دستگاه خود را در نظر بگیرید. حجم برخی از مدل‌هایی که در این فرایند آزمایش کردم به حدود 5GB می‌رسید و این مقدار به‌هیچ‌وجه کم نیست. بااین‌همه، انتخاب نهایی به اولویت شما بستگی دارد: منابع سامانه یا حریم خصوصی. چنان‌که می‌بینید، همه این ابزارها و مدل‌ها رایگان‌اند و همین موضوع برای بیشتر مردم تفاوت مهمی ایجاد می‌کند!

منبع: این مطلب ترجمه و بومی‌سازی مقاله‌ای از MakeUseOf به قلم Abhijith N Arjunan است. مشاهده مقاله اصلی