GPT
N

nvidia_Nemotron-Cascade-2-30B-A3B-GGUF

קוד פתוח

bartowskiother2026-03-21

  • gguf
  • nvidia
  • nemotron-cascade-2
  • reasoning
  • general-purpose

גרסת GGUF מכווצת למודל של אנבידיה שמתאימה למי שרוצה להריץ מודל חשיבה בינוני על חומרה מקומית בלי תלות ברשת.

  • 587 GBמשקל הקבצים
  • 4,219הורדות בחודש
  • 47לייקים

מה זה

המאגר מכיל המרות שונות בפורמט GGUF למודל של חברת אנבידיה, שבוצעו באמצעות llama.cpp עם כיול מבוסס imatrix כדי לצמצם פגיעה באיכות התוכן. המודל מתמקד ביצירת טקסט וכולל תמיכה מובנית בתבנית שיחה עם תגיות ייעודיות לשלב חשיבה מקדים, מה שמכוון אותו לפתרון בעיות שדורשות תכנון לפני מתן התשובה.

המפרסם ארז כאן עשרות רמות דחיסה שונות, החל מקובץ משקל מלא של 63.18 גיגה בייט ועד לקבצים מכווצים מאוד שיורדים לכיוון 18 גיגה בייט. בחלק מהגרסאות, כמו Q4_K_L או Q5_K_L, שכבות הקלט והפלט נשמרו באיכות גבוהה יותר של שמונה ביט כדי לשמור על דיוק התוצאה הסופית, מה שמאפשר גמישות רבה בין צריכת זיכרון לרמת הדיוק הרצויה.

מתאים ל

  • הסקה מקומית מאובטחת

    הרצת מודל אנגלית ישירות על שרת פנימי ללא שליחת מידע רגיש לשירותים חיצוניים.

  • פתרון בעיות הדורשות חשיבה

    ניצול תגית החשיבה המובנית בתבנית השיחה לניתוח שאלות מורכבות שלב אחר שלב.

  • בדיקת ביצועי חומרה מקומית

    בחינת יכולות עיבוד על מעבדי ARM ו־AVX בעזרת קבצים המותאמים לארגון משקלים בזמן אמת.

איפה זה נופל

הקובץ המומלץ ביותר שוקל כמעט 25 גיגה בייט, כך שמחשבים אישיים סטנדרטיים יתקשו לייצר קצב טוקנים שמיש בלי להסתמך על זיכרון מעבד איטי. בנוסף, המודל מוגדר רשמית עבור השפה האנגלית בלבד, ולכן בדיקות בעברית צפויות להניב תוצאות חלשות או משובשות. הגרסאות המכווצות ביותר, כמו קבצי שני ביט שיורדים לאזור 18 גיגה בייט, סובלות מירידה ניכרת באיכות הדיוק ולא מומלצות למשימות מורכבות.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

עבור רוב המשתמשים, גרסת Q4_K_M היא נקודת ההתחלה הנכונה, שכן היא מציעה יחס טוב בין משקל של 24.73 גיגה בייט לבין איכות הפלט. אם הזיכרון מוגבל מאוד, אפשר לרדת לקבצי IQ3, אך רצוי להימנע מגרסאות ה־Q2 שמאבדות מאיכות המודל.

האם המודל מתאים לשימוש בעברית?

המודל הוגדר רשמית עבור אנגלית בלבד. אם תפנו אליו בעברית הוא כנראה יענה, אך התחביר יהיה מאולץ ורמת הדיוק תרד משמעותית לעומת אנגלית.

איך מריצים

כדי להריץ אותו צריך כלי שתומך בפורמט GGUF כמו llama.cpp, LM Studio, או Jan AI. הגרסה המאוזנת והמומלצת לרוב האנשים היא Q4_K_M במשקל 24.73 גיגה בייט, מה שאומר שכרטיס מסך בודד עם 24 גיגה בייט VRAM לא יספיק לבדו בלי לזלוג לזיכרון המערכת.

אם יש לכם מעבד ARM או AVX, גרסאות כמו Q4_0 ו־IQ4_NL תומכות בארגון מחדש של המשקלים בזמן אמת כדי לשפר ביצועים. אם אין לכם לפחות 32 גיגה בייט זיכרון פנוי, או שאין לכם כרטיס מסך מתאים, עדיף לפנות למודל מרוחק דרך ספק ענן במקום לחכות דקות ארוכות לכל תשובה מקומית.

ollama run hf.co/bartowski/nvidia_Nemotron-Cascade-2-30B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

31 קבצים במאגר, 587 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית ולא סופק פירוט ישיר לגבי תנאי השימוש המסחריים שלו. חובה לבדוק את תנאי הרישיון המקוריים של אנבידיה לפני שמשלבים את הקבצים האלה במערכת מסחרית כלשהי.

הרישיון המלא בעמוד המודל ↗