GPT
B

bge-large-zh-v1.5

קוד פתוח

BAAImit2023-09-12

  • sentence-transformers
  • pytorch
  • bert
  • feature-extraction
  • sentence-similarity

מודל וקטורי ייעודי לטקסטים בסינית, שמפיק ייצוגים מדויקים לחיפוש סמנטי. הוא פותר עיוות בציוני דמיון שהיה בגרסאות קודמות, ועובד היטב גם בלי הנחיות מיוחדות לשאילתות.

  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 1,128,186הורדות בחודש
  • 646לייקים

מה זה

מדובר במודל מבוסס ארכיטקטורת ברט עם 24 שכבות, שנועד לייצר וקטורים מטקסט בסינית בלבד עבור מערכות חיפוש ואחזור מידע. גרסה 1.5 מתקנת בעיה שהייתה נפוצה בסדרה, שבה ציוני הדמיון נדחסו לטווח צר שבין 0.6 ל־1 בגלל טמפרטורת אימון נמוכה, וגרמו לטקסטים שונים להיראות קרובים מדי.

בנוסף לתיקון התפלגות הציונים, המודל שופר כדי לשמור על ביצועי אחזור גבוהים גם כשמזינים שאילתות ישירות, בלי להקדים להן מחרוזת הוראה ייעודית. התוצאה היא מודל שמצריך פחות התאמות בקוד לעומת קודמיו, תוך שמירה על רמת דיוק גבוהה בסינית.

מתאים ל

  • חיפוש סמנטי בסינית

    שליפת קטעי מידע רלוונטיים מתוך מאגר מסמכים בסינית על בסיס משמעות ולא רק מילות מפתח.

  • מערכות RAG ממוקדות

    המרת שאילתות ופסקאות קצרות לווקטורים עבור מודלי שפה שפועלים בשוק הסיני.

  • סיווג וקיבוץ טקסטים

    הפקת וקטורים לצורך חלוקת פניות או מאמרים בסינית לקטגוריות על בסיס דמיון נושאי.

איפה זה נופל

החיסרון המרכזי הוא השפה, המודל מאומן לסינית ולא מתאים לעברית, אנגלית או שימוש רב לשוני. אם המערכת שלכם משלבת שפות, הוא פשוט לא יעבוד. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שלא תוכלו להזין מסמכים ארוכים בלי לקטוע אותם מראש. ציוני הדמיון אמנם שופרו בגרסה זו, אך עדיין מחייבים קביעת סף החלטה יחסי ולא הסתמכות על ציון מוחלט.

אותה משפחה

bge-large-zh יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית או באנגלית?

לא. המודל מאומן ומיועד לסינית בלבד, ועבור תמיכה רב לשונית עדיף להשתמש במודל כמו bge-m3 מאותה משפחה.

האם חובה להוסיף הוראה מקדימה לשאילתה?

לא חובה. גרסה 1.5 מאפשרת להזין את השאילתה ישירות עם פגיעה קלה בלבד בביצועים, אם כי בחיפוש שאילתה קצרה מול קטע ארוך עדיין מומלץ להוסיף את המחרוזת הייעודית.

איך מפרשים ציון דמיון שגבוה מ־0.5 בין שני משפטים שונים?

הציונים נוטים להיות גבוהים באופן כללי בגלל אופן האימון, ולכן מה שקובע הוא הסדר היחסי של התוצאות ולא המספר המוחלט. אם נדרש סינון לפי סף, מומלץ לבחון ערכים של 0.8 ומעלה.

איך מריצים

המודל שוקל 1.2 גיגה בייט ומיועד לרוץ בקלות דרך sentence-transformers או ספריית FlagEmbedding. כל כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון יריץ אותו בזמן תגובה מהיר, ואפשר להריץ אותו גם על מעבד רגיל אם עומס השאילתות נמוך.

הבחירה להריץ אותו עצמאית משתלמת במיוחד, כי המשקל שלו קל והוא חוסך עלויות קריאה לשירותי ענן חיצוניים. אם האפליקציה פועלת רק על טקסטים קצרים בסינית, אין הצדקה טכנית לפנות לשירותים בתשלום.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("BAAI/bge-large-zh-v1.5")
v = m.encode(["שלום עולם"])

הרישיון

רישיון MIT מלא. אתם יכולים להשתמש בו במוצרים מסחריים, לשנות את המשקלים, להפיץ אותו ולהריץ אותו בשרתים שלכם בלי הגבלות מיוחדות, כל עוד אתם שומרים על תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗