سافت گذر دانشنامه نرم افزار - دانلود رایگان نرم افزار

اطلاعیه های مهم سایت اطلاعیه های مهم سایت
💐 میلاد زینت پدر حضرت زینب سلام الله علیها مبارک باد 💐
 
 
  1. جهت رفع مشکل باز شدن سایت به دلیل بلاک توسط  نود 32 این ویدیو یا این ویدیو(ورژن 9 به بالا) یا راهنمای تصویری را مشاهده کنید
  2. به مناسبت عید غدیر، در سایت https://esetupdate.ir/ تخفیف ویژه‌ای برای محصولات در نظر گرفته شده است؛ فرصت را از دست ندهید. 🌸
  3. اکانت های بروزرسانی نود32 با قیمت های مناسب به صورت یک ، سه ، شش و دوازده ماهه از اینجا قابل خرید می باشد.

نرم افزار های پرکاربرد

ثبت نام | ورود

اخبار نرم افزار

Ollama حافظه رم را برای پنجره زمینه‌ای هدر می‌دهد؛ تنظیمی برای بازپس‌گیری آن

Ollama حافظه رم را برای پنجره زمینه‌ای هدر می‌دهد؛ تنظیمی برای بازپس‌گیری آن

Ollama برای طول زمینه (Context Length) بسیار بیشتری از آنچه واقعاً استفاده می‌کنید، حافظه رم (RAM) رزرو می‌کند. اگر مدلی با پنجره زمینه ۳۲ هزار توکن بارگذاری شود در حالی که پرسش‌ها و پاسخ‌های شما به‌ندرت از چند هزار توکن فراتر می‌روند، بیشتر آن ظرفیت بی‌استفاده می‌ماند. اما همین ظرفیت بی‌استفاده هم هزینه حافظه دارد.

Ollama باید برای طول زمینه پیکربندی‌شده یک کش کلید-مقدار (KV Cache) تخصیص دهد و این کش می‌تواند چند گیگابایت روی مدل دانلودشده اضافه کند. این مشکل فقط به Ollama محدود نیست؛ همان مسئله بنیادی برای llama.cpp و مدل‌های GGUF که از طریق موتور llama.cpp در LM Studio اجرا می‌شوند نیز صدق می‌کند. روی ماشینی با رم کمتر، می‌توانید پنجره زمینه را به مقداری نزدیک به مصرف واقعی کاهش دهید و حافظه بسیار بیشتری برای سایر کارها آزاد کنید.

Ollama برای زمینه‌ای که ممکن است هرگز استفاده نکنید، حافظه رزرو می‌کند

طول زمینه یک ظرفیت حداکثری است، نه اندازه‌گیری آنچه پرسش فعلی شما مصرف می‌کند. این مقدار شامل اعلان سیستمی (System Prompt)، تاریخچه گفتگو، ورودی فعلی و پاسخ تولیدشده می‌شود. برای مثال، ممکن است مدلی را برای ۳۲ هزار توکن پیکربندی کنید و در یک گفتگوی عادی فقط ۳ هزار توکن استفاده کنید، اما Ollama هنگام بارگذاری همچنان مدل را برای حد بزرگ‌تر آماده می‌کند.

بیشتر این حافظه اضافی به KV Cache می‌رود. این کش محاسبات مربوط به توکن‌هایی را که مدل قبلاً پردازش کرده ذخیره می‌کند تا مجبور نباشد کل گفتگو را دوباره پردازش کند. پنجره زمینه بزرگ‌تر به فضای بیشتری برای این محاسبات نیاز دارد. در Ollama و سایر رانتایم‌های مبتنی بر llama.cpp، اندازه این تخصیص به ظرفیت پیکربندی‌شده گره خورده است، نه به طول پرسش کوتاهی که بعداً می‌فرستید.

اندازه مدل دانلودشده این موضوع را به‌روشنی نشان نمی‌دهد. برای مثال، یک مدل Q4 پنج گیگابایتی می‌گوید وزن‌های کوانتیزه‌شده چقدر فضا اشغال می‌کنند، اما Ollama همچنان به بافرهای محاسباتی (Compute Buffers) و KV Cache نیاز دارد. بنابراین می‌توانید اندازه وزن‌های مدل را کاهش دهید و همچنان چند گیگابایت را به خاطر یک تنظیم زمینه بیش‌ازحد بزرگ از دست بدهید.

روی Apple Silicon، این تخصیص از همان استخر حافظه یکپارچه (Unified Memory) انجام می‌شود که macOS و هر برنامه دیگری از آن استفاده می‌کنند. روی سیستمی با پردازنده گرافیکی اختصاصی، معمولاً حافظه گرافیکی (VRAM) را اشغال می‌کند و وقتی VRAM تمام شود می‌تواند به حافظه سیستم یا حافظه اشتراکی سرریز کند. زمینه بی‌استفاده در این حالت حافظه را از سایر برنامه‌ها می‌گیرد یا بخشی از مدل را به حافظه کندتر می‌راند، بدون آنکه کمکی به درخواست‌های معمول شما کند. پیش‌فرض‌های Ollama روی سیستم‌هایی با VRAM بیشتر این وضعیت را بدتر می‌کنند. این برنامه در حال حاضر برای کمتر از ۲۴ گیبی‌بایت زمینه ۴K، بین ۲۴ تا ۴۸ گیبی‌بایت زمینه ۳۲K و برای ۴۸ گیبی‌بایت یا بیشتر زمینه ۲۵۶K اختصاص می‌دهد.

محدودیت زمینه را بر اساس درخواست‌های واقعی انتخاب کنید

به آن اندازه که فکر می‌کنید به زمینه بزرگ نیاز ندارید. API Ollama اعداد مفیدی برای انتخاب پنجره زمینه ارائه می‌دهد. پاسخ‌های آن شامل prompt_eval_count است که توکن‌های ورودی را گزارش می‌کند و eval_count که توکن‌های تولیدشده را گزارش می‌دهد. می‌توانید این اعداد را در چند گفتگو بررسی کنید تا نقطه شروع بهتری از حداکثر تبلیغ‌شده مدل به دست آورید. تبادل‌های طولانی‌تر خود را هم در این مقایسه بگنجانید تا همه‌چیز را حول یک پرسش کوتاه تنظیم نکنید.

برای گفتگوهای چند هزار توکنی که در اینجا توصیف شد، پیشنهاد می‌شود ابتدا یک پنجره ۸K را آزمایش کنید. این مقدار برای پرسش‌های پیگیری و یک پاسخ غیرعادی طولانی جا می‌گذارد، بدون آنکه فوراً به ۳۲K بپرید. باید مدل‌های استدلالی (Reasoning Models) را متفاوت در نظر بگیرید، چون آن‌ها پیش از پاسخ نهایی توکن‌های تفکر تولید می‌کنند. Ollama این تفکر را جداگانه نمایش می‌دهد، بنابراین پاسخی که در رابط چت می‌بینید لزوماً همه چیزهایی نیست که مدل تولید می‌کند. باید برای آن خروجی هم بودجه حافظه در نظر بگیرید.

می‌توانید لغزنده زمینه را در اپلیکیشن Ollama تغییر دهید یا در یک نشست ترمینال دستور /set parameter num_ctx 8192 را وارد کنید. برای یک تنظیم پایدار مخصوص مدل، می‌توانید از Modelfile استفاده کنید که از PARAMETER num_ctx 8192 پشتیبانی می‌کند. پنجره کوچک‌تر را با گفتگویی آزمایش کنید که به اطلاعات پیام‌های قبلی نیاز دارد. وقتی برش (Truncation) فعال باشد، Ollama پیام‌های قدیمی‌تر را برای رسیدن به محدودیت حذف می‌کند و پیام‌های سیستمی و آخرین پیام را حفظ می‌کند.

دقت کش و درخواست‌های موازی هم نیاز به توجه دارند

Ollama راه دیگری هم برای کاهش مصرف حافظه دارد: ذخیره کش گفتگو با دقت عددی کمی کمتر. به این کار کوانتیزه‌سازی کش (Cache Quantization) می‌گویند. گزینه ۸ بیتی که معمولاً Q8 نامیده می‌شود، تقریباً نصف حافظه کش پیش‌فرض را استفاده می‌کند. محدودیت گفتگوی شما ثابت می‌ماند، هرچند اعداد ذخیره‌شده در کش کمی کم‌دقت‌تر هستند. این صرفه‌جویی فقط به کش اعمال می‌شود، بنابراین نیاز حافظه کل مدل را نصف نمی‌کند.

Q8 گزینه‌ای است که ابتدا باید امتحان کرد، چون اثر آن بر کیفیت پاسخ معمولاً ناچیز است. گزینه ۴ بیتی با نام Q4 حافظه بیشتری ذخیره می‌کند و کش را به حدود یک‌چهارم اندازه اصلی می‌رساند. اما همان‌طور که انتظار دارید، دقت بیشتری از دست می‌رود که می‌تواند بر پاسخ‌ها به‌ویژه در گفتگوهای طولانی‌تر اثر بگذارد. پیش از فعال نگه‌داشتن هر یک از این تنظیمات، پاسخ‌ها را با چند پرسش آشنا مقایسه کنید.

همچنین باید بررسی کنید Ollama برای پردازش هم‌زمان چند درخواست پیکربندی شده است. اگر اجازه می‌دهید چهار گفتگو هم‌زمان پاسخ تولید کنند، فضای کش خود را هدر می‌دهید. اگر چند نفر یا چند برنامه از سرور محلی شما استفاده می‌کنند، می‌توانید این قابلیت را فعال نگه دارید. برای استفاده‌ای مثل فرستادن یک پرسش و انتظار برای پاسخ، دلیل کمی برای رزرو آن ظرفیت اضافی وجود دارد. Ollama در حال حاضر به‌صورت پیش‌فرض یک درخواست هم‌زمان را پردازش می‌کند، بنابراین فقط در صورت افزایش آن باید این تنظیم را دوباره بررسی کنید.

استنتاج‌های دیگر را هم امتحان کنید

Ollama در اجرای مدل‌ها کار بسیار خوبی انجام می‌دهد، اما ممکن است بخواهید گزینه‌های دیگر را هم بررسی کنید. به‌گفته نویسنده، LM Studio برای او بسیار بهتر از Ollama بوده است. همچنین تجربه‌های خوبی با Docker Model Runner و BaseRT داشته است.

نظرتان را ثبت کنید کد خبر: 55097 گروه خبری: اخبار نرم افزار منبع خبر: XDA Developers تاریخ خبر: 1405/07/14 تعداد مشاهده: 3
اخبار مرتبط با این خبر
نظر های کاربران
سرور آپدیت نود 32
پیشنهاد سافت گذر
Ultimate Windows Tweaker 5.2

Ultimate Windows Tweaker 5.2

بهینه سازی ویندوز

طرح توجیهی چیست؟

طرح توجیهی چیست؟

ایده های موفق کسب و کار

بیماری های غدد در طب اسلامی ایرانی

بیماری های غدد در طب اسلامی ایرانی

کبد، طحال، تیروئید و ...

راهنمای استفاده از فیس بوک برای والدین

راهنمای استفاده از فیس بوک برای والدین

آموزش و آشنایی با فیسبوک برای والدین

Blender 5.2.2

Blender 5.2.2

طراحی سه‌بعدی

HQPlayer Desktop 5.4.2

HQPlayer Desktop 5.4.2

پلیر صوتی

دین چیست؟

دین چیست؟

رابطه با خدا

CAMBRIDGE English Grammar in Use (4th Edition) CD-ROM with Audio

CAMBRIDGE English Grammar in Use (4th Edition) CD-ROM with Audio

مجموعه آموزشی گرامر زبان انگلیسی

نخستین کتاب حدیث تاریخ اسلام

نخستین کتاب حدیث تاریخ اسلام

فضائل اهل بیت از زبان پیامبر اکرم صلّی الله علیه و آله

Epitasis + Updates

Epitasis + Updates

فکری برای کامپیوتر

مجله تخصصی برای علاقه مندان به رشته دوچرخه سواری

مجله تخصصی برای علاقه مندان به رشته دوچرخه سواری

مجله Cycling Weekly ژانویه 14؛ 2021

The Amazing Spider-Man 2 v1.2.8d for Android +5.0

The Amazing Spider-Man 2 v1.2.8d for Android +5.0

بازی مرد عنکبوتی نسخه 2

گلچین مداحی اربعین حاج محمود کریمی پنج سال اخیر

گلچین مداحی اربعین حاج محمود کریمی پنج سال اخیر

گلچین اربعین محمود کریمی

ارتباط رایانه به صورت مستقیم

ارتباط رایانه به صورت مستقیم

مروری بر اتصال مغز به کامپیوتر؛ چالش ها، راهکارها و کاربردها

BaldBooth 2.4 for Android +2.3

BaldBooth 2.4 for Android +2.3

موهای سر خود را بتراشید!

Farm Frenzy 2 - Full Version

Farm Frenzy 2 - Full Version

مدیریت مزرعه شلوغ

GPT Everywhere - Desktop AI 2.2.9

GPT Everywhere - Desktop AI 2.2.9

هوش مصنوعی

SoftPerfect RAM Disk 25.12

SoftPerfect RAM Disk 25.12

ایجاد دیسک مجازی برای افزایش سرعت کامپیوتر

آموزش مقدماتی Flash MX

آموزش مقدماتی Flash MX

آموزش فلش ام ایکس

Photo Grid-Photo Collage Maker Premium 8.81 for Android +3.0

Photo Grid-Photo Collage Maker Premium 8.81 for Android +3.0

ترکیب تصاویر

Lynda - Foundations of Programming- Design Patterns

Lynda - Foundations of Programming- Design Patterns

فیلم آموزشی لیندا اصول برنامه‌نویسی - الگوهای طراحی

پوست، جمجمه و استخوان‌های سر، مغز در طب اسلامی

پوست، جمجمه و استخوان‌های سر، مغز در طب اسلامی

آناتومی اسلامی تدریس آیت الله تبریزیان

Pipedata-Pro 15.0.10

Pipedata-Pro 15.0.10

لوله کشی

Lynda - Foundations of Programming- Object-Oriented Design

Lynda - Foundations of Programming- Object-Oriented Design

فیلم آموزشی لیندا اصول برنامه‌نویسی - طراحی شیء‌گرا

FPse 11.212 for Android +2.1

FPse 11.212 for Android +2.1

شبیه ساز پلی استیشن 1 برای آندروید

آموزش کامل فارسی Asp.Net

آموزش کامل فارسی Asp.Net

آموزش ای اس پی دات نت

وسائل الشیعه شیخ حر عاملی

وسائل الشیعه شیخ حر عاملی

تَفْصیلُ وَسائلِ الشیعَة إلی تَحْصیلِ مَسائلِ الشَّریعَة

Kuassa Efektor PAten Graphic Equalizer v1.0.0

Kuassa Efektor PAten Graphic Equalizer v1.0.0

افزایش کیفیت صدا

Motoheroz 2.0.3 for Android +2.3

Motoheroz 2.0.3 for Android +2.3

بازی ماشین شاسی بلند

dbForge Studio for SQL Server Enterprise 2025.3.93

dbForge Studio for SQL Server Enterprise 2025.3.93

توسعه پایگاه‌های داده اس‌کیوال سرور

Windows 7 SP1 AIO December 2025

Windows 7 SP1 AIO December 2025

ویندوز 7

غول های اینترنت ایران و جهان

غول های اینترنت ایران و جهان

بررسی برترین های غول اینترنتی ایران و جهان

آثار و برکات امام و ولایت او در قرآن و روایات از آیت الله سیدمحمدمهدی میرباقری

آثار و برکات امام و ولایت او در قرآن و روایات از آیت الله سیدمحمدمهدی میرباقری

حاج آقا سیدمحمدمهدی میرباقری با موضوع آثار و برکات امام و ولایت او در قرآن و روایات

9 جلسه جذبه های الهی دعوت امام حسین (ع) از حجت الاسلام والمسلمین مسعود عالی

9 جلسه جذبه های الهی دعوت امام حسین (ع) از حجت الاسلام والمسلمین مسعود عالی

حاج آقا مسعود عالی با موضوع جذبه های دعوت امام حسین (ع)؟

DOGOS

DOGOS

هواپیمای جنگنده داگوس

AMC Security - Antivirus Boost 5.12.1 for Android +2.3

AMC Security - Antivirus Boost 5.12.1 for Android +2.3

امنیت و ابزار

Museum Secrets Topkapi Palace Museum Istanbul

Museum Secrets Topkapi Palace Museum Istanbul

مستند اسرار موزه

مجله تخصصی برای علاقه مندان به هنر و ایده های عملی

مجله تخصصی برای علاقه مندان به هنر و ایده های عملی

مجله هنرمندان و تصویرگران سپتامبر سال 2020

ChatON 3.5.839 for Android +2.2

ChatON 3.5.839 for Android +2.2

ارتباط رایگان اینترنتی

سخنرانی استاد رائفی پور با موضوع شب قدر

سخنرانی استاد رائفی پور با موضوع شب قدر

رائفی پور - ماه مبارک رمضان

خبرنامه

با عضویت در خبرنامه، زودتر از همه باخبر باش!