GPT
M

MythoMax-L2-13B-GPTQ

קוד פתוח

TheBlokeother2023-08-11

  • transformers
  • safetensors
  • llama
  • text-generation
  • en

גרסת כימות של מודל מיזוג פופולרי שנועד בעיקר לכתיבה יוצרת ומשחקי תפקידים. הוא משלב שני מודלים שונים כדי לתת מענה עקבי בלי לטחון זיכרון גרפי.

  • 13Bפרמטרים
  • 4,096טוקנים בהקשר
  • 6.8 GBמשקל הקבצים
  • 423הורדות בחודש

מה זה

המודל הזה הוא תוצר של מיזוג טנסורים ניסיוני שביצע היוצר Gryphe בין שני מודלים, MythoLogic ו־Huginn, שניהם מבוססי Llama 2 בגודל 13 מיליארד פרמטרים. הרעיון היה לקחת את יכולת ההבנה של הראשון ולחבר אותה לסגנון הכתיבה העשיר של השני, עם יחס משקלים שונה לכל אחד מ־363 הטנסורים במבנה. TheBloke לקח את התוצאה הזו והמיר אותה לפורמט GPTQ כדי לאפשר הרצה מקומית מהירה וקלה על כרטיסי מסך ביתיים.

בניגוד למודלי בסיס רגילים של Llama 2 שנוטים לענות בצורה יבשה או מסרבים לבקשות עלילתיות, המיזוג כאן נבנה במפורש כדי לייצר דיאלוגים אמינים, סיפורים ארוכים ומשחקי תפקידים מורכבים. הוא מגיב ישירות לתבנית Alpaca ומחזיק חלון הקשר של 4,096 טוקנים, מה שמאפשר לו לזכור היסטוריית שיחה סבירה בלי לאבד את חוט המחשבה באמצע סצנה.

מתאים ל

  • משחקי תפקידים וצ'אטבוטים

    המיזוג בין שני המודלים מייצר אישיות עקבית ודיאלוג טבעי לפי כרטיסי דמות.

  • כתיבת סיפורים ועלילה

    שומר על שפה עשירה וקו עלילתי רציף טוב יותר ממודלי הוראות גנריים.

  • הרצה מקומית על GPU ביתי

    גרסת ה־4 ביט נכנסת כולה בזיכרון של כרטיס RTX 3060 ומעלה בלי איבוד מהירות.

איפה זה נופל

המודל מאומן לחלוטין באנגלית ולא מתאים לעבודה בעברית, שתניב פלט משובש ואיטי. בנוסף, מדובר במודל שמכוון לכתיבה ספרותית ולמשחקי תפקידים, לא לשליפת עובדות, פתרון בעיות מתמטיות או כתיבת קוד. אם תנסו להשתמש בו כמנוע חיפוש או עוזר טכני תקבלו הזיות עובדתיות שנשמעות משכנעות מאוד אבל חסרות כל אחיזה במציאות.

אותה משפחה

MythoMax-L2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל אומן על נתונים באנגלית בלבד. פנייה אליו בעברית תוביל לפלט מקוטע, תרגום עילג ושגיאות תחביר קשות, ולכן הוא לא מתאים למשימות בשפה הזו.

איזו גרסה כדאי להוריד מתוך הענפים השונים?

עבור רוב כרטיסי המסך הביתיים בעלי 8 עד 12 גיגה-בייט של זיכרון, גרסת main או 128g עם Act Order הן הבחירה היציבה והמהירה ביותר. גרסאות ה־8 ביט כבדות כמעט פי שניים, אינן נתמכות ב־ExLlama ודורשות כרטיס מקצועי יותר בלי לתת שיפור מורגש בכתיבה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של Nvidia עם לפחות 12GB של זיכרון גרפי לגרסאות ה־4 ביט, ששוקלות בין 7.26 ל־8 גיגה-בייט. גרסת ה־8 ביט כבר דורשת כ־14 גיגה-בייט זיכרון ולכן תצטרך כרטיס של 16GB ומעלה. הקבצים רצים דרך ספריית AutoGPTQ או באמצעות ExLlama, שנתמך רק בגרסאות ה־4 ביט ומספק מהירות יצירת טוקנים גבוהה משמעותית.

גרסת ברירת המחדל מגיעה בלי Act Order כדי לחסוך משאבים, אבל אם יש לכם מספיק זיכרון כדאי לבחור בענף עם קבוצת גודל 32 ומודול Act Order פעיל שנותן דיוק גבוה יותר. אם אין לכם כרטיס תואם עם מספיק זיכרון ייעודי, עדיף להשתמש בגרסאות GGUF שרצות על המעבד או לקרוא לשירותי אירוח חיצוניים.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/MythoMax-L2-13B-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ומציג מצב מורכב. המודל מבוסס על Llama 2 ולכן כפוף לתנאי הרישיון של מטא, אך היוצר המקורי לא פרסם תנאים ברורים למיזוג עצמו. TheBloke פנה ל־Hugging Face בנושא ולא קיבל תשובה רשמית, ולכן שילוב שלו במוצר מסחרי כרוך באי ודאות משפטית ומחייב בירור מול המפתח המקורי.

הרישיון המלא בעמוד המודל ↗