GPT
B

bge-large-en

קוד פתוח

BAAImit2023-08-02

  • transformers
  • pytorch
  • safetensors
  • bert
  • feature-extraction

מודל שיבוץ אנגלי מבוסס ברט שמפיק וקטורים איכותיים לאחזור וסיווג. הוא מתאים למי שבונה מנוע חיפוש סמנטי או סינון טקסטים ומחפש מודל מוכח להרצה מקומית.

  • 335Mפרמטרים
  • 512טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 42,862הורדות בחודש

מה זה

הוא מבוסס על ארכיטקטורת ברט עם 24 שכבות, וממיר טקסטים באנגלית לווקטורים צפופים שנועדו ללכוד משמעות עמוקה. הייעוד המרכזי שלו הוא משימות של שליפת מידע, דירוג מחדש והשוואת דמיון סמנטי, תחומים שבהם מודלים בגודל הזה מתחרים ישירות בפתרונות סגורים.

במבחני MTEB הוא מציג ביצועים מעורבים שתלויים לחלוטין במשימה. בסיווג פולאריות באמזון הוא מגיע לדיוק של מעל 91 אחוז, ובמשימת דמיון סמנטי כמו BIOSSES הוא רושם מתאם ספירמן של יותר מ־80. לעומת זאת, בסיווג מורכב יותר כמו ביקורות מדורגות הוא נעצר באזור ה־46 אחוז דיוק, מה שאומר שהוא מצטיין בהפרדה ברורה בין קצוות אבל מתקשה בניואנסים דקים.

מתאים ל

  • אחזור מסמכים למנועי חיפוש

    מספק התאמה סמנטית טובה בשאילתות אנגליות הודות לביצועים חזקים במבחני שליפה מגוונים.

  • סיווג כוונות וסנטימנט

    מגיע ליותר מ־91 אחוזי דיוק בסיווג קוטביות ומתאים למיון מהיר של משובים ופניות לקוחות.

  • סינון שאלות כפולות

    מציג ציון MRR של מעל 77 אחוז בדירוג שאלות דומות ומאפשר איתור מהיר של תוכן חופף.

איפה זה נופל

המגבלה הכי כבדה היא השפה, הוא תומך באנגלית בלבד ואין מה לנסות להאכיל אותו בעברית כי התוצאות יהיו חסרות ערך. מעבר לכך, אורך הקלט מוגבל ל־512 טוקנים, כך שטקסטים ארוכים יחייבו חיתוך מוקדם ועיבוד מקדים. בבדיקות אחזור טכניות ומורכבות במיוחד, כמו שאלות מתמטיקה ב־CQADupstack, דיוק האחזור הראשון שלו צונח לכ־23 אחוז בלבד.

אותה משפחה

bge-large-en יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח להתמודד עם מסמכים ארוכים?

לא באופן ישיר. חלון ההקשר שלו מוגבל ל־512 טוקנים, ולכן כל טקסט ארוך יותר ייחתך. אם יש לכם מאמרים או חוזים שלמים, תצטרכו לפרק אותם לפסקאות קטנות ולשמור וקטור נפרד לכל פסקה.

האם הוא מתאים לחיפוש סמנטי בעברית?

ממש לא. הוא אומן על אנגלית בלבד ולא יבין מילים או מבנים בעברית. שימוש בו למאגרי מידע מקומיים יחזיר תוצאות שגויות לחלוטין.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.5 גיגה בייט בפורמט של ספריית הטרנספורמרים. כדי לטעון אותו בדיוק המקורי דרוש כרטיס מסך עם לפחות 4 גיגה זיכרון פנוי לעבודה חלקה, או מעבד חזק אם מריצים אצוות קטנות.

אם אתם צריכים לאנדקס מיליוני מסמכים במהירות או לשמור על זמני תגובה נמוכים מאוד בייצור, עדיף להריץ אותו עצמאית על שרת ייעודי כדי לחסוך עלויות תעבורה. שירות ענן חיצוני עדיף רק אם מדובר בשאילתות בודדות ומקוטעות שלא מצדיקות שרת דלוק קבוע.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="BAAI/bge-large-en")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא. אתם יכולים לקחת אותו, לשלב אותו במוצר מסחרי, לשנות את הקוד ולהפיץ אותו בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית והסרת אחריות מהיוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗