GPT
G

goliath-120b

קוד פתוח

alpindalellama22023-11-05

  • transformers
  • safetensors
  • llama
  • text-generation
  • merge

חיבור של שני מודלים שונים בגודל 70B יצר מפלצת של 118 מיליארד פרמטרים. מי שבוחר בו מחפש יכולת כתיבה עמוקה באנגלית בלי להסתמך על חברות ענן סגורות.

  • 118Bפרמטרים
  • 4,096טוקנים בהקשר
  • 219 GBמשקל הקבצים
  • 356הורדות בחודש

מה זה

מדובר בשילוב שכבות מתוכנן בין Xwin לבין Euryale, שניהם מודלים מאומנים שמבוססים במקור על Llama 2. בעזרת כלי המיזוג mergekit, היוצר שזר מקטעי שכבות לסירוגין עד שהגיע למבנה של 137 שכבות.

המטרה כאן היא לייצר מודל יצירתי וחזק לטקסט חופשי באנגלית. אין בכרטיס תוצאות של מבחני ביצועים רשמיים, כך שאין שום ציון מספרי שמוכיח עליונות על פני מודלים רגילים. השוני העיקרי הוא עומק השכבות, שנבנה כדי לנסות להוציא יכולות של מודל ענק מבלי לאמן מודל כזה מאפס.

המודל מגיב למבנה פקודות של Alpaca או Vicuna. היוצר מציין שמכיוון שהשכבות הראשונות והאחרונות מגיעות מ־Xwin, עדיף להשתמש בפורמט של Vicuna לקבלת תוצאות טובות יותר.

מתאים ל

  • משחקי תפקידים באנגלית

    השילוב של Euryale נותן גמישות סגנונית גבוהה לכתיבה יצירתית ושיחות עמוקות באנגלית.

  • כתיבת סיפורים ותוכן חופשי

    נפח הפרמטרים הגדול מאפשר שמירה על עושר שפתי בסגנון Vicuna במשימות טקסט ארוכות.

  • ניסויי מיזוג מודלים

    בסיס מעניין לבדיקת ביצועים של מודל שנבנה משזירת שכבות של שני אימונים שונים.

איפה זה נופל

חלון ההקשר מוגבל ל־4,096 טוקנים בלבד. למידות האלה זה מעט מאוד חומר קריאה, מה שפוסל עבודה על מסמכים ארוכים או קוד מורכב. בנוסף, המודל אומן ותועד עבור אנגלית בלבד. מי שינסה להפיק ממנו עברית יקבל כנראה ג'יבריש או טעויות קשות, ובכרטיס המודל אין שום התחייבות ליציבות בגלל אופי המיזוג הנסיוני.

שאלות
נפוצות

באיזה פורמט כדאי להזין לו טקסט?

היוצר מציין שגם Vicuna וגם Alpaca יעבדו. עם זאת, בגלל שהשכבות הראשונות והאחרונות שייכות ל־Xwin, ההמלצה הברורה היא להשתמש בפורמט Vicuna.

האם הוא מתאים לעבודה בעברית?

לא. המודל מוגדר עבור השפה האנגלית בלבד. שימוש בעברית לא נבדק וסביר שיניב תוצאות שבורות לחלוטין.

איפה מוצאים גרסאות קלות יותר להרצה?

בכרטיס יש הפניות לגרסאות של TheBloke ו־Panchovix בפורמטים GGUF, GPTQ, AWQ ו־Exllamav2 שמתאימות לכלים כמו vLLM ו־llama.cpp.

איך מריצים

המשקל המקורי מגיע ל־219 גיגה בייט בפורמט float16, מה שאומר שאי אפשר להריץ אותו על כרטיס מסך ביתי בודד. תצטרכו שרת עם מספר כרטיסי מסך כדי לטעון את כל 32 הקבצים האלה לספריית transformers.

למי שרוצה להריץ מקומית בלי חוות שרתים, נוצרו גרסאות מכווצות בפורמטים כמו GGUF, GPTQ, AWQ ו־Exllamav2. הכלים שמתאימים להרצה כזו כוללים את llama.cpp, vLLM, KoboldAI ו־TGW. אם אין לכם חומרה ייעודית כבדה מאוד, עדיף לפנות לפתרונות אירוח קיימים.

from transformers import pipeline

pipe = pipeline("text-generation", model="alpindale/goliath-120b")
print(pipe("שלום"))

הרישיון

הרישיון הוא llama2 של מטא. הוא מאפשר שימוש מסחרי ומחקרי, אבל כפוף למדיניות השימוש של מטא ולהגבלת היקף משתמשים חודשי של פלטפורמת המקור. אם אתם מתכננים לשלב אותו במוצר, חובה לוודא שאתם עומדים בתנאי הרישיון המקוריים של Llama 2.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗