GPT
L

Linq-Embed-Mistral

קוד פתוח

Linq-AI-Researchcc-by-nc-4.02024-05-29

  • sentence-transformers
  • safetensors
  • mistral
  • feature-extraction
  • mteb

מודל שיכוך טקסט מבוסס מיסטרל עם הקשר של 32 אלף טוקנים, שמתאים למי שחייב לאנדקס מסמכים שלמים וארוכים בלי לחתוך אותם לחתיכות קטנות.

  • 7.1Bפרמטרים
  • 32,768טוקנים בהקשר
  • 13.3 GBמשקל הקבצים
  • 16,281הורדות בחודש

מה זה

מדובר במודל שמפיק וקטורים מייצגים לטקסט ונשען על ארכיטקטורת Mistral של 7.1 מיליארד פרמטרים. היתרון המרכזי שהוא מביא לעומת מודלי אמבדינג נפוצים כמו BERT נעוץ בגודל החלון, 32,768 טוקנים שמאפשרים לקרוא קבצים כבדים ברצף אחד במקום לחלק לפסקאות ולאבד את ההקשר הכללי.

במבחני MTEB הוא רושם ביצועים מעורבים. באחזור שאלות ותשובות קצרות כמו Quora או FEVER הוא מציג דיוק גבוה מאוד, עם תוצאות recall של מעל 94 אחוז כבר בעשרת הפריטים הראשונים. לעומת זאת, במשימות אחזור מורכבות יותר כמו MSMARCO או מידע רפואי ב־NFCorpus, מדדי ה־MRR שלו צונחים לאזור ה־38 וה־63, מה שאומר שהרבה פעמים התשובה הרלוונטית לא תצוף ראשונה.

מתאים ל

  • אחזור מסמכים ארוכים

    חלון של 32 אלף טוקנים מאפשר להמיר חוזים וספרים טכניים שלמים לווקטור יחיד באנגלית.

  • זיהוי שאלות כפולות

    מציג מעל 89 אחוז דיוק באחזור וסדר תוצאות במאגרי שאלות דוגמת Quora ו־AskUbuntu.

  • אימות עובדות באנגלית

    משיג MRR של 93.5 במאגר FEVER, ומסייע בחיבור בין טענות למקורות תומכים.

איפה זה נופל

החיסרון המרכזי הוא תמיכה בשפות, המודל אומן ונבדק על אנגלית בלבד ולכן לא יתאים למאגרי מידע בעברית. בנוסף, משימות סיווג רגש מציגות דיוק חלש של 51.8 אחוז, ומבחני אשכול מידע מדעי כמו Medrxiv קיבלו ציון V-measure נמוך סביב 37. המודל גם יקר מאוד להרצה בזמן אמת עקב גודלו, ואינו כולל נתונים בכרטיס לגבי צריכת זיכרון מותאמת תחת קוונטיזציה.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא. המודל מוגדר ומאומן עבור השפה האנגלית בלבד. ניסיון להזין עברית יפגע בדיוק הווקטורים ולא יניב תוצאות אחזור שימושיות.

האם אפשר להשתמש בו במוצר מסחרי?

לא, הרישיון שלו הוא CC BY-NC 4.0 שמונע שימוש מסחרי ישיר או עקיף. אם המוצר שלכם מיועד לחברה או למכירה, תצטרכו לבחור מודל עם רישיון פתוח כמו אפאצ'י או MIT.

האם כדאי להשתמש בו למיון ביקורות קצרות?

לא בהכרח, כי מודל של 7 מיליארד פרמטרים כבד ואיטי מדי למשימות קצרות ופשוטות. לביקורות עדיף להשתמש במודלים קטנים בהרבה שחוסכים כוח מחשוב יקר.

איך מריצים

כדי להריץ אותו מקומית בפורמט float16 המקורי צריך מאיץ גרפי עם לפחות 16 עד 24 גיגה זיכרון, שכן משקל הקבצים לבדו מגיע ל־13.3 גיגה. הטעינה נעשית ישירות דרך ספריית sentence-transformers או transformers הרגילה, אבל כל שאילתה דורשת חישוב של 7 מיליארד פרמטרים.

אם אין לכם כרטיס ייעודי כמו A100 או לפחות RTX 3090, עדיף לחפש ספק שמחזיק API ייעודי לאמבדינג בגודל כזה. הרצה על שרת ענן פשוט תהיה אטית להחריד ותעלה לא מעט כסף רק על זמני החישוב של הווקטורים.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Linq-AI-Research/Linq-Embed-Mistral")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאוסר שימוש מסחרי מכל סוג. אתם יכולים להשתמש בו למחקר, לבדיקות פנימיות או לפרויקטים אישיים, אבל אסור לשלב אותו במוצר שמייצר הכנסות או במערכת ארגונית מסחרית.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗