GPT
M

MN-12B-Lyra-v4-GGUF-IQ-Imatrix

קוד פתוח

Lewdiculouscc-by-nc-4.02024-09-09

  • nemo
  • gguf
  • mistral
  • roleplay
  • sillytavern

כיול של מיסטרל נמו בגודל 12 מיליארד פרמטרים שמיועד לשיחה ולמשחקי תפקידים. הוא עבר קוונטיזציה עם מטריצת חשיבות כדי לשמור על דיוק מקסימלי בקבצים מכווצים.

  • 142 GBמשקל הקבצים
  • 5,763הורדות בחודש
  • 42לייקים

מה זה

מדובר בגרסה מכווצת של מודל שיצר Sao10K על בסיס מיסטרל נמו, שהותאמה לעבודה עם פורמט ChatML. Lewdiculous לקח את המשקלים המקוריים והריץ עליהם קוונטיזציה בתוכנת llama.cpp גרסה b3707 תוך שימוש במטריצת חשיבות, טכניקה שמטרתה לצמצם פגיעה באיכות התוכן בעת דחיסת המשקלים.

המאגר כולל 22 קבצים במשקל כולל של 142 גיגה בייט שמציעים רמות דחיסה שונות ומגוונות. השימוש בפורמט ChatML הופך אותו לנוח לשילוב בממשקים כמו SillyTavern, כאשר היוצר אף מפנה לערכות פרומפטים מוכנות שמותאמות בדיוק למבנה הזה. אין בכרטיס המודל תוצאות של מבחני ביצועים או השוואות כמותיות מול מודלים אחרים, כך שהתאמתו נמדדת בעיקר בטקסט השיחתי שהוא מייצר.

מתאים ל

  • משחקי תפקידים מקומיים

    המודל כויל ספציפית לדיאלוגים מורכבים ועובד חלק עם תבניות ChatML בממשקי שיחה ייעודיים.

  • בדיקת איכות קוונטיזציה

    מגוון קובצי ה־GGUF הגדול מאפשר להשוות ירידת דיוק מול ביצועי חומרה שונים במחשב האישי.

  • פיתוח בוטים לא מסחריים

    פתרון טוב להרצה עצמית של סוכני שיחה מקומיים בלי לשלם על קריאות API ובלי לשתף מידע.

איפה זה נופל

הכרטיס מציג מודל שמכוון למשחקי תפקידים ואינו מיועד לעבודה אנליטית או למשימות קוד מורכבות. השימוש ברישיון מודל הבסיס ושיטת הכיול לא מתועדים מבחינת עובדתיות או עמידות בהזיות, ולכן תצטרכו לבדוק בעצמכם האם הוא ממציא פרטים או סוטה מההנחיות. בנוסף, חובה להקפיד על מבנה ChatML ועל הגדרות הזרקת הטקסט הנכונות, שכן סטייה קטנה מהמבנה שהמודל צופה לו פוגעת ישירות ברציפות ובאיכות התשובות.

שאלות
נפוצות

איזה קובץ צריך להוריד מתוך 22 הקבצים במאגר?

אתם לא מורידים את כל התיקייה ששוקלת 142 גיגה בייט, אלא בוחרים קובץ אחד בלבד לפי זיכרון כרטיס המסך שלכם. רמות כיווץ כמו Q4 מציעות יחס טוב בין צריכת זיכרון לאיכות, בעוד רמות גבוהות יותר ידרשו יותר זיכרון גרפי אך יספקו טקסט מדויק יותר.

איך מגדירים את המודל בתוכנות צד שלישי?

המודל דורש תבנית מסוג ChatML. כדאי להשתמש בערכות ההגדרות המוכנות שהיוצר ממליץ עליהן בכרטיס המודל, כמו אלו של Virt-io או המובנות בתוך SillyTavern, כדי למנוע ירידה באיכות השיחה.

איך מריצים

כדי להריץ את המודל אתם צריכים סביבה מבוססת llama.cpp או מנוע שתומך בקובצי GGUF. גודל של 12 מיליארד פרמטרים ברמות הדחיסה המוצעות דורש כרטיס מסך עם זיכרון ייעודי של 8 עד 16 גיגה בייט כדי לטעון את כל המשקלים וחלון ההקשר ישירות לחומרה הגרפית.

אם אין לכם כרטיס מתאים, המודל ייפול לעיבוד במעבד המרכזי והתגובות יהיו איטיות מדי לשיחה רציפה. מודלים מותאמים אישית כאלה כמעט לא קיימים בספקי ענן מסחריים, כך שאם אתם רוצים את הכיול המסוים הזה, תצטרכו לארח אותו בעצמכם.

ollama run hf.co/Lewdiculous/MN-12B-Lyra-v4-GGUF-IQ-Imatrix:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא cc-by-nc-4.0. המשמעות פשוטה, אסור להשתמש במודל הזה בשום מוצר, פרויקט או תשתית שמייצרים הכנסה או שפועלים במסגרת מסחרית. מותר להשתמש בו, לשנות אותו ולהפיץ אותו מחדש רק לצורכי מחקר, פיתוח פנימי ושימוש אישי, ובתנאי שאתם נותנים קרדיט מלא ליוצרים המקוריים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗