GPT
M

Mixtral-8x7B-MoE-RP-Story-GGUF

קוד פתוח

TheBlokecc-by-nc-4.02023-12-14

  • transformers
  • gguf
  • mixtral
  • not-for-all-audiences
  • nsfw

גרסת GGUF של מיקס מומחים שמיועד למשחקי תפקידים וכתיבת סיפורים. מתאים למי שרוצה להריץ מקומית מודל יצירתי רב־תחומי בלי להחזיק שרת כפול.

  • 225 GBמשקל הקבצים
  • 4,214הורדות בחודש
  • 51לייקים

מה זה

המודל הזה נבנה במקור על ידי Undi כמיזוג מומחים (MoE) על בסיס Bagel, במטרה לשמש לצ'אט, משחקי תפקידים וכתיבה עלילתית. המבנה שלו מורכב משילוב של שמונה מודלים שונים: שני מודלי משחק תפקידים, שני מודלי שיחה, מודל כתיבה, מודל מתמטיקה, מודל מיסטיקה, ומודל שעבר אימון DPO כדי לספק תשובות שמרגישות אנושיות יותר.

TheBloke המיר אותו לפורמט GGUF עבור llama.cpp, מה שמאפשר להריץ אותו על מעבדים וכרטיסים ביתיים עם זיכרון משותף. אין בכרטיס מבחני ביצועים כמותיים או ציונים רשמיים, והיוצר המקורי אף ציין שזהו הניסיון הראשון שלו בבניית ארכיטקטורה כזו.

מתאים ל

  • משחקי תפקידים מקומיים

    שילוב מומחי שיחה ומשחק תפקידים מייצר אינטראקציות עשירות יותר בצ'אט פרטי.

  • כתיבה יצירתית ועלילתית

    כולל רכיבים שאומנו ספציפית על בניית סיפורים וטקסט ספרותי.

  • ניסויי שילוב מומחים מקומיים

    מתאים למי שרוצה לבדוק התנהגות של מיזוג מודלים על גבי llama.cpp.

איפה זה נופל

יוצר המודל המקורי מזהיר במפורש שגרסאות ה־K של GGUF עבור מודלי Mixtral עשויות להיות שבורות, וממליץ להשתמש בגרסאות ישנות יותר כמו Q4_0, Q5_0 או Q8_0. מעבר לזה, תבנית הפרומפט אינה מוגדרת באופן חד משמעי בכרטיס ומפנה למגוון התבניות של Bagel, מה שדורש ניסוי וטעייה. מודל שמורכב משמונה מומחים שונים עלול לייצר חוסר עקביות בטון, ובמיוחד לא הייתי סומך עליו למשימות שדורשות דיוק עובדתי או קוד.

שאלות
נפוצות

איזו גרסת כימות כדאי להוריד למחשב עם 32GB זיכרון?

לפי הכרטיס, גרסאות ה־K עשויות להיות פגומות במיקסטרל, ולכן מומלץ לבחור בגרסת Q4_0 ששוקלת 26.44 גיגה בייט ודורשת קרוב ל־29 גיגה בייט זיכרון ללא פריקה לכרטיס מסך. גרסאות Q5 ומעלה כבר יחרגו מנפח הזיכרון הפנוי שלכם.

איך צריך לנסח את הפרומפט למודל הזה?

בכרטיס לא צוינה תבנית יחידה, ונכתב שהיא מבוססת על האפשרויות הקיימות ב־Bagel. תצטרכו לבדוק את התבניות של Bagel או להשתמש במצב שיחה רגיל ב־llama.cpp עם הדגל המתאים כדי לראות מה מניב תוצאות עקביות.

איך מריצים

המודל דורש זיכרון עבודה משמעותי. הקבצים נעים בין 15.64 גיגה בייט בגרסת Q2_K החלשה ביותר ועד 49.62 גיגה בייט בגרסת Q8_0, שדורשת מעל 52 גיגה בייט זיכרון כדי לעלות ללא עזרת כרטיס מסך. הגרסה המאוזנת המומלצת בדרך כלל, Q4_K_M, שוקלת 26.44 גיגה בייט ודורשת לפחות 29 גיגה בייט זיכרון כדי לנשום.

אפשר להריץ אותו דרך llama.cpp, LM Studio או ספריית llama-cpp-python. אם אין לכם לפחות 32 גיגה בייט של זיכרון RAM או כרטיס עם מספיק זיכרון וידאו לפריקת שכבות, המחשב יזחל. במקרה כזה, עדיף לפנות למודל מנוהל דרך ספק צד שלישי במקום לנסות לדחוף אותו בכוח לחומרה מקומית.

ollama run hf.co/TheBloke/Mixtral-8x7B-MoE-RP-Story-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: מותר להוריד, לשנות ולהריץ את המודל לשימוש אישי או מחקרי, אבל חל איסור מוחלט על כל שימוש מסחרי. אי אפשר לגבות עליו כסף, למכור שירות סביבו, או לשלב אותו במוצר שמייצר הכנסה בלי להפר את תנאי השימוש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗