GPT
N

NemoMix-Unleashed-12B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2024-08-22

  • transformers
  • gguf
  • mergekit
  • merge
  • text-generation

גרסת קוונטיזציה מגוונת של מודל מיקס בגודל 12 מיליארד פרמטרים. היא נועדה למי שרוצה ביצועים סבירים של יצירת טקסט על חומרת צרכנים מקומית בלי לרוקן את הכיס.

  • 153 GBמשקל הקבצים
  • 18,796הורדות בחודש
  • 131לייקים

מה זה

מדובר במארז קובצי שקילה מכוילים בשיטת imatrix עבור המודל NemoMix Unleashed 12B, שמבוסס במקור על עבודה של MarinaraSpaghetti. היעד המרכזי של ההפצה הזו הוא לאפשר הרצה מקומית גמישה דרך llama.cpp, כשהדגש הוא על יצירת טקסט חופשית יחסית לגודל כזה.

הייחוד הטכני כאן מתבטא בעיקר בניסוי של היוצר לשמר את משקלי ה־embed וה־output ברמת דיוק גבוהה של Q8_0 גם בגרסאות מכווצות יותר, כמו Q4_K_L או Q5_K_L. הרעיון הוא לבלום את ההידרדרות באיכות הפלט וההבנה של המודל כשדוחסים אותו לזיכרון נמוך. אין בכרטיס תוצאות מבחנים רשמיות או מדדי בנצ'מרק, כך שאי אפשר לכמת בדיוק את השיפור בלי להריץ בפועל.

ההורדות הרבות והלייקים מראים שיש עניין במיקס הזה, בעיקר בקרב קהילת הקוד הפתוח שמחפשת אלטרנטיבות מקומיות בקטגוריית הביניים של 12 מיליארד פרמטרים. עם זאת, הוא לא מציג חידוש ארכיטקטוני אלא בעיקר אריזה טובה של קוונטיזציה מותאמת.

מתאים ל

  • עבודה מקומית ב־LM Studio

    קובצי ה־GGUF המוכנים נטענים מיידית לעבודה פרטית על מחשב אישי בלי תלות ברשת.

  • הפקה יצירתית ללא צנזורה

    סדרת Unleashed מכוונת לחופש כתיבה רחב יותר ממודלי בסיס שמרניים.

  • ניסויי קוונטיזציה

    מגוון הפורמטים הגדול מתאים לבדיקת ביצועים מדויקת על חומרות מוגבלות.

איפה זה נופל

הבעיה הבולטת ביותר היא היעדר תיעוד בסיסי. בדף לא מופיע פורמט הפרומפט שבו אומן המודל, ואתם נדרשים לחפש אותו עצמאית בעמוד של מודל המקור. בלי הפורמט הנכון, הפלטים עלולים להישבר בקלות. בנוסף, לא קיימות בדיקות ביצועים רשמיות, אין מידע על התנהגות בעברית, והגרסאות המכווצות מתחת ל־4 ביט מציגות ירידה מורגשת באיכות הניסוח וההיגיון.

שאלות
נפוצות

איזה קובץ כדאי להוריד אם יש לי כרטיס עם 8GB VRAM?

קובץ Q4_K_S או IQ4_XS יתאימו בדיוק. שניהם שוקלים סביב 7GB ומשאירים מקום סביר לחלון ההקשר בזיכרון של הכרטיס.

למה התשובות של המודל יוצאות מוזרות או מקוטעות?

כנראה שאינכם משתמשים בתבנית הפרומפט הנכונה. מאחר שהתבנית לא צוינה כאן, חובה לבדוק את הדף המקורי של MarinaraSpaghetti ולהגדיר את הטמפלייט בהתאם.

איך מריצים

ההרצה הפשוטה ביותר מתבצעת ישירות דרך LM Studio או שימוש ישיר ב־llama.cpp עם תוכנת huggingface-cli כדי למשוך את הקובץ המתאים. אם יש לכם כרטיס מסך עם 12GB זיכרון, גרסת Q4_K_M ששוקלת 7.48GB או Q5_K_M ששוקלת 8.73GB ייכנסו בשלמותן ויספקו קצב יצירה מהיר.

מי שמחזיק מעבד בלבד או זיכרון גרפי צנוע יכול לרדת לגרסאות ה־IQ כמו IQ3_M שדורשת פחות מ־6GB, אם כי על מעבדים או דרך Vulcan הן עלולות לרוץ לאט יותר. אם אתם צריכים זמינות של עשרות בקשות בשנייה או דיוק לשוני קריטי, עדיף לשלם לפי טוקן ל־API של מודל ענן חזק במקום להעמיס את החומרה המקומית שלכם.

ollama run hf.co/bartowski/NemoMix-Unleashed-12B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד של המודל. המשמעות ברורה. אסור לשלב אותו בשום מוצר מסחרי, יישום שמופץ ללקוחות או שירות פנימי בחברה בלי לברר קודם את תנאי המקור של המודל שעליו הוא מבוסס.

הרישיון המלא בעמוד המודל ↗