GPT
S

SFR-Embedding-2_R

קוד פתוח

Salesforcecc-by-nc-4.02024-06-14

  • sentence-transformers
  • safetensors
  • mistral
  • feature-extraction
  • mteb

מודל שיכוך מבוסס מיסטרל שנועד לשליפה וסיווג טקסטים באנגלית. הוא דורש משאבים כבדים, אך מספק חלון הקשר נדיר של 32 אלף טוקנים למסמכים שלמים.

  • 7.1Bפרמטרים
  • 32,768טוקנים בהקשר
  • 13.2 GBמשקל הקבצים
  • 17,737הורדות בחודש

מה זה

המודל הזה בנוי על גבי MistralModel ומתמחה בהפקת וקטורים איכותיים מטקסטים ארוכים במיוחד באנגלית. היכולת המרכזית שלו היא עיבוד של עד 32,768 טוקנים בהרצה אחת, מה שפותר את הצורך לחתוך מאמרים טכניים או מסמכים משפטיים למקטעים זעירים שמאבדים הקשר.

בבדיקות MTEB הוא מפגין יכולת שליפה ודיוק יוצאי דופן במשימות ממוקדות. למשל, במבחן FEVER הוא מגיע לדיוק שליפה של 88.2 אחוז כבר בתוצאה הראשונה, ובמבחן HotpotQA הציון עומד על 85.4 אחוז. עם זאת, במאגרים מורכבים כמו NFCorpus הדיוק הראשוני צונח לאזור ה־53 אחוז, כך שהביצועים תלויים מאוד בסוג השפה ובמבנה המידע שאתם סורקים.

מתאים ל

  • סריקת מסמכים ארוכים באנגלית

    חלון של 32 אלף טוקנים מאפשר להמיר חוזים או מאמרים שלמים לווקטור יחיד בלי פירוק למקטעים.

  • אימות עובדות ומחקר

    התוצאות במבחן FEVER מראות דיוק גבוה מאוד באיתור מקורות רלוונטיים לשאלות ספציפיות.

  • חיפוש שאלות ותשובות מורכב

    מבנה המודל מתאים לשליפת תשובות מתוך מאגרי דיונים טכניים באנגלית עם הקשר רחב.

איפה זה נופל

הבעיה הבולטת הראשונה היא שהמודל אומן על אנגלית בלבד. אם תזינו טקסטים בעברית תקבלו וקטורים שבורים וחסרי ערך. בנוסף, אף שהחלון ענקי, מודל כזה מייצר זמני תגובה איטיים משמעותית בהשוואה למודלים קטנים של כמה מאות מיליוני פרמטרים, מה שמקשה על שימוש בו בתוך מערכות שדורשות מענה בזמן אמת.

שאלות
נפוצות

האם המודל יתאים לחיפוש מסמכים בעברית?

לא. המודל הוגדר ואומן על השפה האנגלית בלבד, וכל ניסיון לעבד טקסט עברי יוביל לתוצאות גרועות.

האם אפשר להשתמש בו באפליקציה מסחרית?

לא. הרישיון הוא רישיון לא־מסחרי בלבד, כך שמותר להשתמש בו רק לניסויים, בדיקות פנימיות ומחקר אקדמי.

איך מריצים

כדי להריץ מודל עם שבעה מיליארד פרמטרים בדיוק float32, תצטרכו כרטיס גרפי רציני עם לפחות 32 גיגה זיכרון וידאו, בטח אם אתם בונים על ניצול מלא של חלון ההקשר. הקבצים עצמם שוקלים 13.2 גיגה ומנוהלים דרך ספריית sentence-transformers המוכרת.

אם אין לכם שרת ייעודי זמין עם חומרה ברמה הזו, או שאתם מחפשים מענה מיידי בעומס משתנה, החזקה עצמית של המודל תעלה לכם יותר מאשר פנייה לשירותי ענן שמספקים שיכוך לפי קריאה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Salesforce/SFR-Embedding-2_R")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון cc-by-nc-4.0. הרישיון הזה מתיר לכם להוריד, לבדוק ולבצע מחקר, אבל אוסר במפורש כל שימוש מסחרי ישיר או עקיף. אם אתם בונים מוצר שמייצר הכנסות או מיועד ללקוחות משלמים, אי אפשר להשתמש בו.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗