GPT
M

MN-12B-Mag-Mell-R1-GGUF

קוד פתוח

mradermacherרישיון לא דווח2024-09-16

  • transformers
  • gguf
  • mergekit
  • merge
  • en

גרסת GGUF סטטית למודל של 12 מיליארד פרמטרים שמתאימה להרצה מקומית על מחשב אישי. היא מיועדת למי שמחפש קובץ שרץ ישירות בתוכנות כמו llama.cpp בלי להסתבך עם התקנות כבדות.

  • 94.3 GBמשקל הקבצים
  • 29,395הורדות בחודש
  • 56לייקים

מה זה

מדובר בהמרה של המודל MN-12B-Mag-Mell-R1 לפורמט GGUF, אותה ביצע mradermacher. הדף המקורי לא מפרט על מה בדיוק אימנו את מודל הבסיס או לאילו משימות ספציפיות כיוונו אותו, חוץ מזה שהוא מוגדר לשפה האנגלית. מה שכן מקבלים כאן זה חבילה רחבה מאוד של רמות קוונטיזציה סטטיות, שמאפשרות לבחור בדיוק את רמת הדחיסה שמתאימה לזיכרון שלכם.

היוצר צירף קישורים לגרפי השוואה של מדדי פרפלקסיטי עבור סוגי הדחיסה השונים, שבהם ערך נמוך יותר מצביע על פחות שגיאות ופגיעה קטנה יותר ביכולת המודל. לפי ההערות בכרטיס, קוונטים מסוג IQ מספקים יחס ביצועים עדיף מול קוונטים רגילים באותו משקל, למשל IQ3_S שמציג תוצאות טובות יותר ממשפחת Q3_K. אם יש לכם צורך בדיוק מרבי, קיימת גם חבילת כיול עם מטריצת חשיבות בעמוד נפרד של אותו יוצר.

מתאים ל

  • עבודה מקומית באנגלית

    הרצה מקומית על כרטיסי מסך ביתיים עם 8 גיגה זיכרון בלי לשלוח נתונים החוצה.

  • ניסויי קוונטיזציה שונים

    בדיקת ההשפעה של דחיסות IQ מול Q3 סטנדרטי על זיכרון ומהירות.

  • עיבוד טקסטים לא מקוון

    ניתוח מסמכים באנגלית על מחשב מנותק מרשת עם גרסת ה־4 ביט המומלצת.

איפה זה נופל

הבעיה המרכזית היא חוסר מוחלט בתיעוד לגבי טיב המודל, מטרות האימון שלו או תוצאות של מבחני ביצועים מקובלים. היוצר מציין במפורש שגרסת Q3_K_M סובלת מאיכות נמוכה, ורמות הדחיסה האגרסיביות בהחלט פוגעות בהבנה וביכולת לעקוב אחרי הוראות מורכבות. בנוסף, המודל מוגדר לאנגלית בלבד, כך שאי אפשר לצפות ממנו לעבודה אמינה בעברית בלי לבדוק אותו ביסודיות מראש.

שאלות
נפוצות

איזו גרסה מומלצת להתחלה?

היוצר מסמן את Q4_K_M ואת Q4_K_S כגרסאות מהירות ומומלצות לשימוש כללי. הן שוקלות סביב שבעה גיגה וחצי ומספקות איזון נכון בין גודל לאיכות פלט.

האם המודל תומך בעברית?

המודל מוגדר רשמית לאנגלית בלבד. לא צוין אימון על שפות נוספות, ולכן לא מומלץ להסתמך עליו למשימות בעברית.

איך מריצים

כדי להריץ אותו צריך מנוע שתומך בפורמט הזה, למשל llama.cpp. גרסאות הביניים המומלצות, כמו Q4_K_M או Q4_K_S, שוקלות סביב 7.2 עד 7.6 גיגה בייט, מה שאומר שכרטיס מסך מודרני עם 8 עד 12 גיגה זיכרון יחזיק אותן במלואן בלי לזלוג לזיכרון הראשי של המחשב. אם הזיכרון בכרטיס מוגבל, אפשר לרדת לגרסאות ה־3 ביט כמו IQ3_XS ששוקלת 5.4 גיגה בייט.

כשעולים לרמות הדיוק הגבוהות כמו Q8_0, הקובץ כבר שוקל 13.1 גיגה בייט ודורש כרטיס עם לפחות 16 גיגה זיכרון. אם אין לכם חומרה ייעודית בכלל ואתם מתכננים להריץ משימות שוטפות רק על מעבד מרכזי, זמן התגובה יהיה איטי מאוד, ובמקרה כזה עדיף לשלם לפי שימוש לספק ענן חיצוני.

ollama run hf.co/mradermacher/MN-12B-Mag-Mell-R1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד של הקוונטיזציה וגם לא צוינו תנאי השימוש של מודל המקור. מבחינה משפטית, כשאין רישיון מוגדר אסור להניח שהשימוש המסחרי מותר, ולכן שילוב שלו במוצר מסחרי כרוך בסיכון של הפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗