GPT
N

nvidia_Llama-3_3-Nemotron-Super-49B-v1-GGUF

קוד פתוח

bartowskiother2025-03-18

  • gguf
  • nvidia
  • llama-3
  • text-generation
  • en

גרסת GGUF מכווצת למודל של אנבידיה שיושב בין 8 ל־70 מיליארד פרמטרים. פתרון למי שרוצה ביצועים קרובים למודל ענק בלי להחזיק שרת כפול.

  • 715 GBמשקל הקבצים
  • 1,690הורדות בחודש
  • 52לייקים

מה זה

המאגר הזה מציג המרות קוונטיזציה שביצע המשתמש bartowski למודל Llama-3_3-Nemotron-Super-49B-v1 של חברת אנבידיה. במקום המודל המקורי במשקל מלא, המפתח השתמש בגרסה b4915 של llama.cpp עם כיול imatrix כדי לייצר מגוון רחב של קבצים מכווצים. המשקל של המודל השלם בפורמט bf16 מגיע לכמעט 100 גיגה בייט, אך באמצעות טכניקות הכיווץ השונות המשקל יורד עד לכ־14 גיגה בייט ברמות הנמוכות ביותר.

המטרה בגודל של 49 מיליארד פרמטרים היא לגשר על הפער בין מודלים של 8 או 14 מיליארד, שלעיתים חסרים עומק אנליטי, לבין מודלים כבדים של 70 מיליארד שדורשים חומרה יקרה בהרבה. המודל מתמקד ביצירת טקסט באנגלית, ועושה שימוש בתבנית הפרומפטים המוכרת של משפחת Llama 3 עם תגיות מערכת ומשתמש. בכרטיס המודל אין נתוני מדידה ביצועיים או מבחני השוואה לאיכות הפלט של המודל עצמו, אלא רק נתוני מהירות טכניים של הרצת מעבד מול גרסאות שונות של llama.cpp. לכן איכות התוכן עצמו תיקבע לפי הניסיון שלכם איתו בפועל.

מתאים ל

  • הרצה מקומית בארגון

    מאפשר לעבד טקסטים באנגלית על גבי חומרה ארגונית בלי להוציא נתונים רגישים החוצה.

  • סביבת פיתוח עם LM Studio

    פורמט ה־GGUF נתמך ישירות בתוכנה ומאפשר בדיקת פרומפטים בלחיצת כפתור.

  • עיבוד על שרתי מעבד ו־ARM

    קובצי Q4_0 ו־IQ4_NL נתמכים באופטימיזציה מקומית לפעולה על מעבדים ללא כרטיס ייעודי.

איפה זה נופל

הקובץ מוגדר לשפה האנגלית בלבד, ולכן לא מומלץ לבנות עליו לפרויקטים שדורשים עברית טבעית או תרגום שוטף. מעבר לזה, הכרטיס אינו כולל שום מבחני דיוק, מדדי שגיאה או בדיקות בטיחות של אנבידיה עצמה. ירידה לקבצים המכווצים בשיטות IQ2 או Q2 חותכת את המשקל לאזור 14 עד 19 גיגה בייט, אך מובילה לפגיעה ממשית באיכות הטקסט ובהבנת ההקשר.

שאלות
נפוצות

איזה קובץ הכי מתאים לכרטיס מסך ביתי רגיל?

אם יש לכם כרטיס עם 24 גיגה בייט זיכרון, קובץ כמו IQ3_M ששוקל כ־22.66 גיגה בייט ייכנס במלואו, אך איכותו נמוכה בהשוואה ל־Q4.

האם המודל תומך בריצה על מעבדי AMD?

הוא רץ על AMD אבל שיטות כיווץ מסוג IQ לא נתמכות בתשתית Vulcan, אלא דורשות התקנת build שמבוסס על rocBLAS.

איך מריצים

כדי להריץ אותו מקומית צריך לבחור קובץ אחד בלבד מתוך הרשימה בהתאם לזיכרון הפנוי. גרסת Q4_K_M שוקלת כ־30.22 גיגה בייט ונחשבת לברירת המחדל המאוזנת, כך שתצטרכו כרטיס מסך עם לפחות 32 גיגה בייט VRAM, או פיצול בין כרטיס מסך קטן יותר לבין זיכרון המערכת.

מי שמחזיק מעבדי ARM או מעבדי אינטל ו־AMD מודרניים יכול להשתמש בקובצי Q4_0 או IQ4_NL שנהנים מאריזה מחדש בזמן ריצה. אם אין לכם לפחות 32 גיגה זיכרון פנוי ייעודי לעיבוד, עדיף לצרוך מודל כזה דרך ספק API חיצוני במקום לגרור זמני תגובה ארוכים על המעבד הביתי.

ollama run hf.co/bartowski/nvidia_Llama-3_3-Nemotron-Super-49B-v1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

32 קבצים במאגר, 715 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של המודל מוגדר כ־other, והכרטיס אינו מפרט את התנאים המשפטיים המלאים. המשמעות היא שאין אישור מסחרי גורף וברור במקום, ומי שמתכנן להטמיע את הקבצים האלה בתוך מוצר פעיל או שירות בתשלום חייב לבדוק את תנאי השימוש המקוריים שפרסמה חברת אנבידיה לפני ההפצה.

הרישיון המלא בעמוד המודל ↗