GPT
G

GritLM-8x7B

קוד פתוח

GritLMapache-2.02024-02-11

  • transformers
  • pytorch
  • safetensors
  • mixtral
  • text-generation

מודל מבוסס Mixtral שמטפל גם באחזור מידע וגם ביצירת טקסט תחת אותם משקלים. הוא חוסך תחזוקה של מודל אמבדינגס נפרד בצד מודל השפה.

  • 47Bפרמטרים
  • 32,768טוקנים בהקשר
  • 174 GBמשקל הקבצים
  • 8,931הורדות בחודש

מה זה

במקום להחזיק מודל ייעודי ליצירת וקטורים ועוד מודל שפה נפרד לחלק של התשובה, הפרויקט הזה מנסה לסגור את שתי המשימות יחד. הוא נשען על ארכיטקטורת תערובת המומחים של מיקסטרל עם 47 מיליארד פרמטרים וחלון הקשר של 32,768 טוקנים, ואומן על הדאטה סט tulu2 לצד משימות דירוג.

תוצאות המדידה שלו בלוח המבחנים של MTEB מראות שהוא עושה עבודה סבירה למדי באחזור ובסיווג. בדיוק של סיווג בינארי באמזון הוא מגיע ל־96.3 אחוז, ובמשימות אחזור טכניות מורכבות כמו CQADupstack הוא מציג תוצאות ממוצעות של סביב 40 עד 60 ב־ndcg@10. המשמעות היא שהוא שולף מסמכים רלוונטיים ברמה דומה למודלי אחזור ייעודיים, בלי לאבד את היכולת לייצר טקסט חופשי.

מתאים ל

  • אחזור ויצירה במערכת אחת

    חוסך את הצורך לנהל מודל וקטורי נפרד ומודל שפה נפרד באותו שרת.

  • סיווג טקסט טכני באנגלית

    מציג ציונים גבוהים במבחני דמיון וסיווג על שאלות תכנות ומאמרים.

  • אינדוקס מסמכים ארוכים

    תומך בחלון של עד 32 אלף טוקנים לחיפוש עומק בטקסטים מורכבים.

איפה זה נופל

הבעיה העיקרית היא המורכבות התפעולית. לחלץ וקטורים ממודל בגודל 47 מיליארד פרמטרים זה תהליך איטי ובזבזני להחריד בהשוואה למודל אמבדינגס ייעודי של כמה מאות מגה בייט.

בנוסף, כל המבחנים שצורפו אליו עוסקים בטקסטים באנגלית, בעיקר סביב פורומים טכניים וביקורות. אין שום תיעוד או בדיקה לגבי הביצועים שלו בעברית, כך שסביר להניח שבשפה המקומית הוא יתקשה מאוד גם בהבנה וגם בדירוג.

אותה משפחה

GritLM יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יכול להחליף מודל אמבדינגס קטן כמו bge?

טכנית כן, מעשית זה לא כדאי. הוא ייתן תוצאות דומות אבל ידרוש פי עשרה יותר זיכרון וזמן חישוב לכל משפט שתנסו לאנדקס.

כמה זיכרון כרטיס מסך צריך כדי לעבוד איתו?

הקבצים שוקלים 174 גיגה בייט, כך שצריך לפחות 160 עד 180 גיגה בייט של זיכרון גרפי פנוי רק להרצה בסיסית בדיוק מלא.

איך מריצים

כדי להריץ אותו מקומית צריך מערך חומרה כבד מאוד. המשקלים לבדם שוקלים 174 גיגה בייט בדיוק של bfloat16, מה שאומר שצריך לפחות שני כרטיסי A100 של 80 גיגה בייט רק כדי להטעין אותו לזיכרון לפני שבכלל מתחילים להריץ שאילתות.

אם אין לכם שרת ייעודי בענן שרץ באופן קבוע, העלות של החזקת חומרה כזו לצורך ניסויים לא משתלמת. עדיף בהרבה להשתמש בספק שמציע גישה למודל דרך ממשק תוכנה, אלא אם המידע שלכם רגיש ואסור לו לצאת מהתשתית המקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="GritLM/GritLM-8x7B")
print(pipe("שלום"))

הקבצים

51 קבצים במאגר, 174 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, כך שאפשר להטמיע אותו במוצרים פנימיים או מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗