GPT
B

bge-large-en-v1.5

קוד פתוח

BAAImit2023-09-12

  • sentence-transformers
  • pytorch
  • onnx
  • safetensors
  • bert

אחד ממודלי הווקטורים המובילים באנגלית מבוסס ארכיטקטורת ברט. מיועד למי שמחפש דיוק גבוה במיוחד באחזור טקסטים קצרים ומוכן לשלם על זה בזמן חישוב.

  • 335Mפרמטרים
  • 512טוקנים בהקשר
  • 3.7 GBמשקל הקבצים
  • 13,169,864הורדות בחודש

מה זה

מדובר במודל שפותח באקדמיה הסינית לבינה מלאכותית ומטרתו לחלץ וקטורים מייצגים מטקסט באנגלית. עם 24 שכבות ודיוק float32, הוא מיועד לשמש בסיס למנועי חיפוש סמנטי, סיווג וסינון תוכן. הביצועים שלו נמדדו במבחני MTEB מגוונים, ושם הוא מציג תוצאות מעורבות שתלויות בסוג המשימה.

בסיווג קוטביות של ביקורות הוא פוגע מצוין עם דיוק של 92.41 אחוזים, אבל בסיווג מורכב יותר של ביקורות עם מספר דרגות הוא צונח לדיוק של 48.17 אחוזים בלבד. באחזור מידע, כמו במבחן ArguAna, הוא מגיע לציון recall@10 מרשים של 88.4 אחוזים, מה שמראה שהוא מצליח להציף תוצאות רלוונטיות לעשירייה הראשונה אבל לא תמיד שם את התוצאה המושלמת בראש הרשימה.

מתאים ל

  • אחזור לקטעי טקסט קצרים

    מצוין לשליפת פסקאות מתוך מאגר שאלות ותשובות באנגלית, בזכות recall גבוה בעשירייה הראשונה.

  • זיהוי כוונות משתמש

    מתאים לניתוב פניות בצ'אטים באנגלית, כפי שמוכיח ציון f1 של מעל 87 אחוזים במבחן בנקאות.

  • אשכול מאמרים מדעיים

    מייצר וקטורים שמפרידים טוב בין נושאים, עם מדדי V-measure מוכחים במאגרי arxiv וביולוגיה.

איפה זה נופל

המגבלה הכי קריטית כאן היא חלון ההקשר, שעומד על 512 טוקנים בלבד. אם תזרקו עליו מסמכים ארוכים, חוזים או מאמרים שלמים, הוא פשוט יחתוך את הסוף. מעבר לכך, המודל אומן על אנגלית בלבד. אם המערכת שלכם צריכה לטפל בעברית, המודל הזה יפיק תוצאות גרועות, ולא הייתי נוגע בו לפרויקטים ישראליים מקומיים בלי תרגום מוקדם.

אותה משפחה

bge-large-en יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לאחזור מסמכים בעברית?

לא, המודל אומן ומוגדר לשפה האנגלית בלבד. בעברית הוקטורים שלו יאבדו את המשמעות הסמנטית שלהם ועדיף לחפש מודל רב לשוני.

כמה זיכרון כרטיס מסך נדרש כדי להריץ אותו?

הקבצים שוקלים 3.7 גיגה בייט בפורמט float32. כרטיס מסך עם 8 גיגה זיכרון יספיק לעבודה רציפה, ואפשר להריץ אותו גם על מעבד רגיל אם העומס נמוך.

האם הוא מסוגל לאנדקס מסמכים שלמים וארוכים?

לא באופן ישיר, בגלל מגבלת הזיכרון של 512 טוקנים. כדי לאנדקס תוכן ארוך צריך לפצל אותו לפסקאות קטנות מראש ורק אז להריץ את המודל.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers או transformers הרגילה בפייתון. קובצי המשקל שוקלים 3.7 גיגה בייט, כך שצריך כרטיס מסך פשוט עם לפחות 6 או 8 גיגה זיכרון כדי להריץ תהליכי עיבוד בקצב הגיוני, אם כי אפשר להריץ אותו גם על מעבד רגיל במחיר של מהירות.

אם אתם צריכים לאנדקס מיליוני מסמכים בשעה ואין לכם שרת ייעודי, תחזוקה עצמית שלו תהיה כאב ראש ועדיף לקחת פתרון מנוהל. לעומת זאת, אם הדאטה רגיש וחייב להישאר ברשת הפנימית, הגודל הזה עדיין קל מספיק לפריסה עצמאית בלי לקרוע את התקציב.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("BAAI/bge-large-en-v1.5")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ תחת רישיון MIT. המשמעות פשוטה וישירה, מותר להשתמש בו למוצרים מסחריים, לשנות אותו, להריץ אותו על שרתים פנימיים או למכור שירותים שנבנו סביבו, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗