GPT
S

SFR-Embedding-Mistral

קוד פתוח

Salesforcecc-by-nc-4.02024-01-24

  • sentence-transformers
  • safetensors
  • mistral
  • feature-extraction
  • mteb

מודל שיעבוד טקסטים ארוכים במיוחד לוקטורים איכותיים באנגלית. הוא מבוסס על מיסטרל שבעה מיליארד ומספק דיוק גבוה בחיפוש סמנטי מורכב.

  • 7.1Bפרמטרים
  • 32,768טוקנים בהקשר
  • 13.3 GBמשקל הקבצים
  • 33,393הורדות בחודש

מה זה

מדובר במודל שמייצר וקטורים מטקסט על בסיס הארכיטקטורה של מיסטרל, כשהוא מאומן למשימות של שליפת מידע, סיווג והשוואת דמיון. בניגוד לרוב מודלי השיעבוד הקטנים שמבוססים על ארכיטקטורות ישנות, הגודל הזה מעניק לו הבנה סמנטית עמוקה בהרבה של הקשרים מורכבים בתוך פסקאות ארוכות.

במבחני הביצועים של מדד MTEB הוא רושם ציונים חזקים מאוד בשליפה עובדתית, עם ציון recall של מעל 95 אחוזים בעשר התוצאות הראשונות במאגר FEVER, ומעל 92 אחוזים במאגר ArguAna. מצד שני, במשימות סיווג מורכבות יותר כמו רגשות או דירוגי מוצרים רב שכבתיים, הביצועים שלו צונחים לאזור ה־50 עד 54 אחוזי דיוק, מה שמראה שהכוח האמיתי שלו נמצא באחזור מידע ולא בהכרח בהכרעות תוכן עדינות.

מתאים ל

  • חיפוש במאמרים אקדמיים

    יכולת הדחיסה של מסמכים ארוכים הופכת אותו למעולה בשליפת מאמרים דומים מקבצי מחקר.

  • אימות טענות ועובדות

    בדיקות הראו מעל 95 אחוזי איתור נכון של מקורות מידע תומכים במאגר FEVER באנגלית.

  • אחזור למערכות RAG מורכבות

    מתאים כשצריך לשלוף חלקי קוד או מסמכים טכניים ארוכים עבור מודלי שפה אחרים.

איפה זה נופל

הבעיה המרכזית שלו היא השפה: המודל מאומן ומתועד עבור אנגלית בלבד. אם תזרקו עליו עברית, הוקטורים יאבדו חלק ניכר מהמשמעות שלהם ולא תקבלו תוצאות חיפוש אמינות. מעבר לזה, חלון הקשר ענקי דורש כוח עיבוד כבד מאוד בזמן ריצה, והוא אינו מתאים למי שמחפש זמני תגובה של אלפיות שניה בשרת זול.

שאלות
נפוצות

האם המודל יתאים לחיפוש טקסטים בעברית?

לא. המודל מתועד ומוגדר לשפה האנגלית בלבד. הרצה של עברית תפגע קשות באיכות הוקטורים ובדיוק השליפה.

אפשר להשתמש בו במוצר מסחרי של החברה?

לא. הרישיון המדווח הוא שימוש לא מסחרי בלבד, כך שאי אפשר להטמיע אותו במוצרים שמייצרים כסף.

מה המחשב המינימלי שצריך כדי לבדוק אותו מקומית?

חובה כרטיס מסך עם לפחות 16 גיגהבייט VRAM לטעינה בסיסית, ויותר מכך אם תעבדו עם טקסטים ארוכים מאוד.

איך מריצים

כדי להריץ מודל במשקל 13.3 גיגהבייט בדיוק float16 צריך כרטיס מסך עם לפחות 16 עד 24 גיגהבייט זיכרון רק כדי לטעון אותו, ועוד זיכרון ייעודי אם מתכננים לנצל חלון הקשר מלא של מעל שלושים אלף טוקנים. ההרצה נעשית ישירות דרך ספריית sentence-transformers או transformers הרגילה.

אם כל מה שאתם צריכים זה לחפש משפטים בודדים או קטעים קצרים, להחזיק שרת כזה באוויר זה בזבוז משאבים מוחלט. עדיף לפנות ל־API מסחרי או לרדת למודלים קטנים בהרבה, אלא אם כן אתם מחויבים לפרטיות מוחלטת של המידע ובאמת מעבדים מסמכים שלמים במכה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Salesforce/SFR-Embedding-Mistral")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון כאן הוא cc-by-nc-4.0. המשמעות פשוטה וחד משמעית: מותר להשתמש בו למחקר, ניסויים ופיתוח פנימי, אבל אסור לשלב אותו בשום מוצר מסחרי, שירות בתשלום או פעילות עסקית שמניבה הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗