GPT
M

MythoMax-L2-Kimiko-v2-13B-GGUF

קוד פתוח

TheBlokecc-by-nc-4.02023-08-31

  • transformers
  • gguf
  • llama

גרסת GGUF למיזוג בין MythoMax ל־Kimiko שנועדה להרצה מקומית קלה. מתאימה למי שמחפש מודל 13B לכתיבה יצירתית או משחקי תפקידים ולא רוצה להרים שרת יקר.

  • 91.9 GBמשקל הקבצים
  • 12,881הורדות בחודש
  • 45לייקים

מה זה

מדובר במיזוג של Undi95 בין MythoMax-L2-13b לבין ה־LoRA של Kimiko-v2-13B במשקל 0.50, מבוסס Llama 2. המטרה של המיזוג הזה היא לשפר יכולות שיחה, כתיבת סיפורים ומשחקי תפקידים ביחס למודלי בסיס רגילים. TheBloke לקח את המשקלים והמיר אותם לפורמט GGUF עבור הרצה מקומית בכלים כמו llama.cpp.

המודל מגיע במגוון רמות כימוס מ־2 ביט ועד 8 ביט. הדף לא כולל ציוני מבחנים או בנצ'מרקים כמותיים, כך שאי אפשר להשוות את הביצועים המדויקים שלו מול מודלים אחרים במספרים יבשים. במקום זה, הדגש כאן הוא על זמינות של קבצים מכויללים שמתאימים לרוחבי פס שונים של זיכרון.

מתאים ל

  • משחקי תפקידים מקומיים

    המיזוג של Kimiko מותאם למנועים כמו KoboldCpp ומאפשר לנהל אינטראקציות ודמויות במחשב האישי ללא חיבור רשת.

  • כתיבת סיפורים וטיוטות

    השילוב של MythoMax תוכנן במקור להפקת טקסט נרטיבי, ומתאים לכותבים שרוצים שותף לסיעור מוחות מקומי.

  • בדיקות הרצה ב־llama.cpp

    קבצי GGUF במשקלים שונים נוחים לבדיקת ביצועים ומגבלות זיכרון על מעבדים וכרטיסי מסך שונים.

איפה זה נופל

בכרטיס אין שום נתוני מדידה, ציונים או הערכת שגיאות רשמית. המודל מתבסס על פורמט הפרומפט של Alpaca, ואם לא תקפידו עליו במדויק תקבלו תוצאות פחות טובות. כמו כן, מדובר במיזוג שמיועד לכתיבה יצירתית, לא למשימות תכנות, ניתוח נתונים או היגיון מתמטי.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך ה־18 שיש במאגר?

עבור רוב האנשים הבחירה הנכונה היא mythomax-l2-kimiko-v2-13b.q4_K_M.gguf. הוא מאזן טוב בין שימור האיכות לגודל קובץ של 7.87 גיגה בייט. אם יש לכם מספיק זיכרון ואתם רוצים פחות פגיעה באיכות, קחו את גרסת Q5_K_M.

האם אפשר להשתמש במודל הזה באפליקציה בתשלום?

לא. הרישיון המוגדר הוא cc-by-nc-4.0, שאוסר במפורש שימוש מסחרי מכל סוג. בנוסף חלים עליו התנאים של Llama 2, כך שהוא מתאים למחקר, ניסויים ושימוש אישי בלבד.

איך מריצים

אין שום סיבה להוריד את כל המאגר ששוקל 91.9 גיגה בייט, אלא בוחרים קובץ בודד לפי החומרה שיש לכם. הגרסה המומלצת למרבית השימושים היא Q4_K_M ששוקלת 7.87 גיגה בייט ודורשת 10.37 גיגה בייט זיכרון בלי פריקה לכרטיס מסך, או Q5_K_M ששוקלת 9.23 גיגה בייט ודורשת 11.73 גיגה בייט RAM לאיכות גבוהה יותר. גרסאות Q2 ו־Q3 סובלות מאיבוד איכות מורגש, ו־Q8 שוקלת 13.83 גיגה בייט וכבר כבדה מדי בלי יתרון מעשי.

אפשר להריץ אותו מקומית דרך llama.cpp, תוכנות כמו LM Studio ו־KoboldCpp, או בסקריפט פייתון עם ספריית ctransformers. אם אין לכם כרטיס מסך עם לפחות 12 גיגה בייט זיכרון כדי לפרוק אליו שכבות, תצטרכו להסתמך על מעבד וזה יעבוד לאט בהרבה.

ollama run hf.co/TheBloke/MythoMax-L2-Kimiko-v2-13B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מסומן ברישיון cc-by-nc-4.0 שמונע שימוש מסחרי, אך כיוון שהוא מבוסס על Llama 2 הוא כפוף גם לתנאי השימוש של Meta. לפי כרטיס המודל, יש כאן מצב של רישוי כפול שלא הוסדר רשמית מול Hugging Face, כך שאסור להשתמש בו למוצרים מסחריים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗