GPT
M

MythoMax-L2-13B-GGUF

קוד פתוח

TheBlokeother2023-09-05

  • transformers
  • gguf
  • llama
  • en

מיזוג משקלים מבוסס Llama 2 שמיועד למי שצריך כתיבה יוצרת או משחקי תפקידים מקומיים. הוא פופולרי בגלל שילוב מוצלח של הבנת הנחיות ועושר טקסטואלי בגודל 13B.

  • 91.9 GBמשקל הקבצים
  • 27,087הורדות בחודש
  • 277לייקים

מה זה

המודל הוא תוצר של מיזוג ניסיוני ברמת הטנסורים בין MythoLogic-L2 לבין Huginn, שניהם מבוססי Llama 2 בנפח 13 מיליארד פרמטרים. המפתח שילב 363 טנסורים ביחסים משתנים עם גרדיאנטים ייעודיים, כשהמטרה היא לקחת את יכולת ההבנה של המודל הראשון כקלט ואת סגנון הכתיבה של השני כפלט. הגרסה הזו כוללת קובצי GGUF שהומרו על ידי TheBloke כדי לאפשר הרצה מקומית יעילה.

במקום אימון רגיל על נתונים חדשים, המיזוג מנסה לתפוס שתי ציפורים במכה אחת. הוא מיועד בעיקר לתרחישי משחקי תפקידים וכתיבת סיפורים, תחומים שבהם מודלים רגילים נוטים לחזרתיות או לאיבוד הדמות. אין בכרטיס המודל תוצאות של מבחני ביצועים מקובלים כמו MMLU, כך שההערכה לגביו נשענת על התנהגות בפועל במשימות טקסט חופשי ולא על ציונים יבשים.

מתאים ל

  • משחקי תפקידים ודמויות

    המיזוג נבנה במיוחד כדי לשמור על אופי של דמות בשיחה ולא לסטות מההנחיות.

  • כתיבת סיפורים ועלילה

    משלב את יכולת הכתיבה של Huginn לצורך יצירת טקסט עשיר ורציף בלי עצירות.

  • עוזר שיחה מקומי

    רץ על כלי שולחן עבודה פרטיים בלי לשלוח שום מידע לשרתים חיצוניים.

איפה זה נופל

המודל הזה לא נועד למשימות קוד, חילוץ נתונים, או פתרון בעיות לוגיות מורכבות. המיזוג מכוון כולו לכתיבה יצירתית ולשיחה, כך שבמשימות טכניות הוא יפגר אחרי מודלים ייעודיים. בנוסף, הוא תומך באנגלית בלבד לפי התיעוד, ולכן לא מתאים לעבודה שוטפת בעברית. לפני שמשלבים אותו במערכת, צריך לקחת בחשבון שהוא דורש מבנה פרומפט ספציפי בסגנון Alpaca כדי לייצר תשובות עקביות.

אותה משפחה

MythoMax-L2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את כל הקבצים שמופיעים בעמוד?

ממש לא. המאגר כולל שיטות כימוס שונות לאותו המודל. מורידים רק קובץ אחד שמתאים לכמות הזיכרון שיש לכם במחשב, למשל mythomax-l2-13b.Q4_K_M.gguf לשימוש מאוזן.

האם המודל יודע לייצר קוד או לנתח מסמכים טכניים?

הוא לא מיועד לזה. המודל עבר אופטימיזציה לטקסט סיפורי, דיאלוגים ומשחקי תפקידים, ובמשימות פיתוח הוא יציג תוצאות נחותות לעומת מודלים כלליים או מודלי קוד.

איך מריצים

קובצי ה־GGUF מאפשרים להריץ את המודל דרך llama.cpp, ממשקי משתמש כמו LM Studio, Faraday.dev ו־KoboldCpp, או בספריות פייתון כמו llama-cpp-python ו־ctransformers. אין צורך להוריד את כל המאגר ששוקל מעל 91 ג'יגהבייט, אלא בוחרים קובץ בודד. הגרסה המאוזנת והמומלצת, Q4_K_M, שוקלת כמעט 8 ג'יגהבייט ודורשת לפחות 10.37 ג'יגהבייט של זיכרון עבודה כדי לרוץ על המעבד, או כרטיס מסך עם זיכרון תואם כדי לפרוק אליו שכבות.

גרסאות מכווצות יותר כמו Q2 או Q3 יחסכו מקום וידרשו פחות זיכרון, אבל הירידה באיכות הטקסט מורגשת מאוד. אם יש לכם מחשב עם 16 ג'יגהבייט זיכרון או מעבד גרפי סביר, הרצה מקומית עובדת חלק ובלי תלות ברשת. אם אין לכם חומרה ייעודית בכלל, פנייה לשירותי ענן שמארחים את המודל תהיה פשוטה בהרבה.

ollama run hf.co/TheBloke/MythoMax-L2-13B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other, ובנוסף המודל כפוף לתנאי הרישיון המקורי של Meta עבור Llama 2. אין פה רישיון קוד פתוח סטנדרטי מסוג MIT או Apache, ויש אי בהירות לגבי האופן שבו שני הרישיונות משתלבים יחד. מי שרוצה להכניס את המודל הזה למוצר מסחרי צריך לבדוק את התנאים בעמוד המקורי של Gryphe ולוודא שהשימוש עומד במגבלות של Llama 2.

הרישיון המלא בעמוד המודל ↗