هرچه ابزارهای هوش مصنوعی راه خود را به میان گروههای گستردهتری از مردم باز میکنند، استقبال از راهکارهای آفلاینی که دادهها و درخواستها را به سرورهای دیگران نمیفرستند نیز بیشتر میشود.
بااینحال، بیشتر مردم نمیدانند که میتوانند مدلهای هوش مصنوعی را بهصورت محلی روی گوشی اندرویدی خود اجرا کنند؛ مدلهایی که از پس کارهای سنگینی هم برمیآیند.
مهمتر اینکه بسیاری از کارهای قابل انجام با هوش مصنوعی محلی، با درنظرگرفتن عواملی مانند حریم خصوصی و هزینه، در حالت آفلاین بهتر انجام میشوند. در ادامه پنج کاربرد هوش مصنوعی محلی در اندروید را مرور میکنیم.
گفتوگو و بازنویسی متن
حریم خصوصی و سرعت در برابر هم نیستند





گرفتن پاسخهای فوری برای پرسشهای روزمره و بازنویسی متن، دو مورد از رایجترین کاربردهای چتباتهای هوش مصنوعیاند. همین کارها را میتوان بهآسانی با یک برنامهٔ هوش مصنوعی محلی در اندروید انجام داد. بزرگترین مزیت چیست؟ هنگام کار با اطلاعات حساس، دیگر لازم نیست نگران حریم خصوصی باشید؛ زیرا محتوا هرگز از دستگاهتان خارج نمیشود. بسته به مدلی که برمیگزینید، پردازش نیز میتواند بسیار سریع باشد.
برای رسیدن به این هدف چند راه پیش رو دارید. سادهترین و کارآمدترین گزینه این است که مدلی مناسب را از طریق Google AI Edge Gallery راهاندازی کنید و هر زمان به بازنویسی متنی یا گفتوگو نیاز داشتید، آن را فراخوانی کنید. در AI Edge Gallery میتوانید از میان AI Chat برای گفتوگوهای چندمرحلهای و Prompt Lab برای بازنویسی یکباره یکی را برگزینید. اگر برای نوشتن به پژوهش پیشرفتهتری نیاز دارید، پیشنهاد میکنم از مهارت Wikipedia در حالت Agent نیز بهره بگیرید.
البته نباید انتظار سرعتی همپای ChatGPT یا Gemini را داشته باشید. بااینهمه، وقتی با محتوای حساسی سروکار دارید که نمیخواهید برای آموزش مدلها به کار رود، کمی شکیبایی به حفظ حریم خصوصیتان میارزد.
درک تصاویر
هوش مصنوعی تصویری هم به سرور نیاز ندارد





تا چندی پیش، مدلهای هوش مصنوعی قابلاجرا روی دستگاه تنها به کارهای متنی محدود بودند؛ اما تازهترین مدلهای Gemma گوگل این وضعیت را تغییر دادهاند. ازآنجاکه Gemini و Google Lens برای پاسخ به هر پرسش تصویری به فضای ابری متصل میشوند، استفاده از سامانهای آفلاین برای شناسایی اشیای درون تصویر یا توصیف آن مزایای مهمی دارد. خوشبختانه برنامهٔ AI Edge Gallery این امکان را فراهم میکند.
برای اجرای بخش Ask Image در برنامهٔ Edge Gallery میتوانید یکی از چهار مدل Gemma را برگزینید؛ مدلهایی که بسته به توان دستگاهتان عملکردی چشمگیر ارائه میکنند. من این قابلیت را روی گوشی خود با ۱۶ GB رم آزمودم و فرایند بسیار روان بود. میتوانید همان لحظه عکسی بگیرید یا تصویری را که از پیش دارید بارگذاری کنید. مدل Gemma در مجموع عملکرد خوبی دارد، هرچند گاهی دچار توهم میشود و اطلاعات نادرست میسازد.
بااینحال، هرگاه به شرحی گامبهگام از تصویری نیاز داشته باشید که نمیخواهید ارائهدهندگان خدمات ابری به آن دسترسی پیدا کنند، قابلیت Ask Image در Edge Gallery این کار را بهخوبی انجام میدهد.
پیادهسازی گفتار به متن
تایپ صوتی، بینیاز از وایفای






در زمینهٔ تبدیل گفتار به متن، برنامههای بیشماری پیدا میشوند که هر ماه هزینهٔ گزافی میگیرند؛ اما بیشترشان بهجای پردازش روی دستگاه، به پردازش ابری متکیاند. یعنی واژههایی که بر زبان میآورید باید به سروری متعلق به شخص ثالث فرستاده شوند. به لطف توان روزافزون مدلهای هوش مصنوعی محلی، اکنون میتوانید این کار را بهآسانی روی دستگاه خود انجام دهید؛ بنابراین برای نوشتن متنی بلند با صدا، دیگر به وایفای نیاز ندارید.
تازهترین نسخهٔ AI Edge Gallery برای قابلیت Audio Scribe چهار مدل در اختیارتان میگذارد که میتوانند محتوای ضبطشده یا بارگذاریشده را به متن تبدیل کنند. محدودیت این بخش آن است که طول هر قطعه نمیتواند از ۳۰ ثانیه بیشتر باشد. بااینحال، پیشنهاد من FUTO Keyboard است؛ صفحهکلیدی متنباز برای اندروید با امکانات فراوان که مهمترینشان تایپ صوتی است. این صفحهکلید با بهرهگیری از مدلهای روی دستگاه، گفتار شما را به متن تبدیل میکند و متن نهایی را نیز بهخوبی میپیراید.
اصلاح خودکار و پیشبینی واژهها روی خود دستگاه نیز از دیگر قابلیتهای FUTO Keyboard هستند که بسیار دوستشان دارم. این صفحهکلید همچنین اجازه میدهد متن را روان و مستقیم در کادر مربوط وارد کنید، بیآنکه مجبور باشید مدام و با کندی میان برنامهها جابهجا شوید.
گفتوگو با پروندههای پیدیاف
سندی که هرگز از گوشیتان خارج نمیشود





بیشتر ما با سندهای PDF سروکار داریم که در حالت عادی حاضر نیستیم آنها را در ابزارهای هوش مصنوعی بارگذاری کنیم، اما بهخاطر راحتی این کار، سرانجام تن به آن میدهیم. همین نگرانیهای مربوط به حریم خصوصی است که استفاده از ابزارهای هوش مصنوعی محلی را برای چنین کاری منطقیتر میکند. خوشبختانه چند راه برای گفتوگو با فایلهای PDF وجود دارد که در آنها سندها هرگز از گوشی هوشمندتان خارج نمیشوند. من بهتازگی برای قابلیتهای محلی RAG از برنامهای به نام Anvit استفاده میکنم که یک مدل محلی Gemma را به کار میگیرد!
با توجه به اینکه Anvit ساخته یک توسعهدهنده مستقل است، امکان گفتوگو با سندهای PDF را بهشکلی شگفتانگیز فراهم میکند! این فرایند چند دقیقه زمان میبرد که دانلود مدل اصلی هوش مصنوعی و مدل مکمل RAG نیز در همین مدت انجام میشود. پس از پایان این مرحله، Anvit از شما میخواهد فایل PDF موردنظر را بارگذاری کنید تا برای RAG آماده شود. پس از آن میتوانید بهآسانی با محتوای همان سند PDF گفتوگو کنید.
همانطور که میتوان حدس زد، استفاده از برنامهای مانند Anvit بسیار منطقیتر از آن است که سندهای شرکتی یا فایلهای کاری خود را در فضای ابری بارگذاری کنید.
اجرای یک مدل زبانی بزرگِ کامل
اعداد بنچمارک مرا قانع کردند






در نهایت، شاید بخواهید یک مدل زبانی بزرگ و همهمنظوره را نیز روی دستگاه خود اجرا کنید؛ چون چنین کاری کاملاً منطقی است. خوشبختانه، اگر مدلهای مناسب را در اختیار داشته باشید، AI Edge Gallery این امکان را برایتان فراهم میکند. این بخش از برنامه هوش مصنوعی به شما اجازه میدهد چند مدل غیر Gemma، مانند Qwen ۲.۵ Instruct و DeepSeek R1 Distill، را نیز اجرا کنید. بهاینترتیب، حتی بدون داشتن دستگاهی بسیار قدرتمند هم میتوانید یک مدل زبانی بزرگِ کامل را اجرا کنید.
قابلیت گفتوگوی هوش مصنوعی در جایگاه یک مدل زبانی بزرگ چندوجهی عملکرد بسیار خوبی دارد و هر گفتوگو میتواند تا ۱۰ تصویر و یک قطعه صوتی 30ثانیهای را پشتیبانی کند. میتوانید درست مانند ChatGPT یا Claude با آن گفتوگو کنید، هرچند سرعت اجرا به دستگاه و منابع در دسترس بستگی دارد. میزان اختیاری که برنامه AI Edge Gallery در دسترس کاربر میگذارد نیز ستودنی است؛ زیرا میتوانید شمار توکنها، گزینههای شتابدهنده و حتی اعلان سیستمی را تنظیم کنید.
به یاد داشته باشید که بسته به شیوه پیکربندی، برخی مدلها مصرف پردازنده و حافظه رم را افزایش میدهند. بااینحال، میتوان با این مسئله کنار آمد؛ زیرا این مدلها بدون اتصال به اینترنت نیز اجرا میشوند.
کاستیهای هوش مصنوعی محلی
همانطور که پیداست، راهکارهای هوش مصنوعی محلی برای همه دستگاهها نسخهای یکسان و بینقص نیستند! بنابراین پیش از انتخاب مدل مناسب باید عواملی مانند حافظه رم، فضای ذخیرهسازی و سرعت پردازش دستگاه خود را در نظر بگیرید. حجم برخی از مدلهایی که در این فرایند آزمایش کردم به حدود 5GB میرسید و این مقدار بههیچوجه کم نیست. بااینهمه، انتخاب نهایی به اولویت شما بستگی دارد: منابع سامانه یا حریم خصوصی. چنانکه میبینید، همه این ابزارها و مدلها رایگاناند و همین موضوع برای بیشتر مردم تفاوت مهمی ایجاد میکند!
منبع: این مطلب ترجمه و بومیسازی مقالهای از MakeUseOf به قلم Abhijith N Arjunan است. مشاهده مقاله اصلی