GPT
G

GritLM-7B

קוד פתוח

GritLMapache-2.02024-02-11

  • transformers
  • pytorch
  • safetensors
  • mistral
  • text-generation

שילוב נדיר בין יצירת טקסט לבין חיפוש ודירוג וקטורי באותו משקל. אם נמאס לכם להחזיק מודל נפרד לשיחה ומודל נפרד לחיפוש, זה הכיוון.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 27.0 GBמשקל הקבצים
  • 50,834הורדות בחודש

מה זה

בבסיס שלו יושבת ארכיטקטורה מוכרת של Mistral בגודל שבעה מיליארד פרמטרים, אבל האימון כאן שונה לגמרי. הוא אומן על סט הנתונים tulu2 ומכוון לביצועים חזקים במיוחד במשימות MTEB, שזה אומר חיפוש, דירוג מחדש (reranking), קיבוץ וסיווג. במקום להשתמש במודל שפה רגיל רק כדי לפלוט מילים, הוא מפיק וקטורים איכותיים ישירות מהשכבות שלו.

מבחני הביצועים מראים תמונה ברורה. בסיווג פשוט כמו קוטביות ביקורות באמזון הוא מגיע לדיוק של 96.5 אחוז, ובמשימות דירוג שאלות טכניות כמו AskUbuntu הוא מוציא MRR של מעל שמונים אחוז. בחיפושי מידע מורכבים יותר מתוך קהילות מפתחים, כמו CQADupstack, הדיוק בשליפה הראשונה יורד לכיוון שלושים עד ארבעים אחוז, שזה אופייני למודלים בגודל הזה אבל מבהיר שלא מדובר בקסם.

מתאים ל

  • איחוד רכיבי RAG

    חיבור שליפת המידע ויצירת התשובה במערכת אחת, בלי לנהל שני מודלים שונים בשרת.

  • סינון ודירוג שאלות טכניות

    מציג תוצאות חזקות במיוחד בזיהוי שאלות כפולות ודירוג מחדש בפורומים טכנולוגיים.

  • סיווג טקסטים בינארי

    מגיע ליותר מ־96 אחוזי דיוק בניתוח סנטימנט וקוטביות של טקסטים ומסמכים.

איפה זה נופל

הוא מנסה לעשות שני דברים במקביל, ובחלק מהמשימות רואים את הפשרה. במבחני אחזור טכניים מורכבים כמו מתמטיקה הוא מציג דיוק ראשוני חלש של 25 אחוז בלבד, ובסיווג ביקורות מרובות מחלקות הוא בקושי עובר את 57 האחוזים. מעבר לזה, כל מבחני הביצועים בכרטיס הם באנגלית. אין כאן שום מידע או ערובה לגבי איך וקטורי החיפוש שלו יתמודדו עם עברית, וסביר להניח ששם תראו נפילה חדה.

אותה משפחה

GritLM יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יכול להחליף מודל הטמעה ייעודי כמו BGE?

כן, לשם בדיוק כיוונו אותו. ברוב מבחני ה־MTEB הוא נותן פייט יפה למודלים ייעודיים, עם היתרון שהוא גם יודע לייצר טקסט בסוף התהליך.

כמה זיכרון כרטיס מסך אני חייב בפועל?

במשקל המלא שלו בפורמט bfloat16 תצטרכו כרטיס של 24 גיגה לפחות עבור משימות קצרות, ועדיף שרת ייעודי אם אתם מתכוונים לנצל את כל 32 אלף הטוקנים.

איך מריצים

המשקל המקורי מגיע בקבצי bfloat16 שתופסים 27 גיגה בייט בזיכרון האחסון. כדי להריץ אותו כמו שהוא עם כל 32 אלף הטוקנים של ההקשר, צריך כרטיס מסך רציני עם לפחות 24 גיגה זיכרון VRAM, וגם זה יהיה גבולי בעומס. קוואנטיזציה לארבעה ביטים תאפשר לכם לדחוף אותו לכרטיסים נגישים יותר בלי לשבור את הבנק.

הוא נתמך ישירות דרך ספריית transformers הרגילה של פייתון. אם אתם צריכים רק מודל שפה רגיל לכתיבה או שיחה, אין שום סיבה להריץ דווקא אותו לבד, עדיף לקחת מודל Mistral רגיל או לגשת ל־API מסחרי. ההשקעה בברזלים מקומיים עבורו משתלמת רק כשאתם בונים ארכיטקטורת אחזור ורוצים לאחד תהליכים.

from transformers import pipeline

pipe = pipeline("text-generation", model="GritLM/GritLM-7B")
print(pipe("שלום"))

הרישיון

הוא משוחרר תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולשלב אותו במוצרים פנימיים או חיצוניים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗