GPT
B

bge-multilingual-gemma2

קוד פתוח

BAAIgemma2024-07-25

  • sentence-transformers
  • safetensors
  • gemma2
  • feature-extraction
  • sentence-similarity

הטמעות טקסט מדויקות למסמכים ארוכים על בסיס ארכיטקטורה של מודל שפה כבד. פתרון מתאים למי שבונה חיפוש סמנטי ומחפש דיוק גבוה במיוחד בלי להתפשר על אורך הקלט.

  • 9.2Bפרמטרים
  • 8,192טוקנים בהקשר
  • 34.4 GBמשקל הקבצים
  • 156,054הורדות בחודש

מה זה

מדובר במודל הטמעות טקסט שמבוסס על הארכיטקטורה של Gemma 2, ומיועד לחילוץ מאפיינים וחיפוש סמנטי. הוא מגיע עם תמיכה בעשרות שפות וחלון הקשר של 8,192 טוקנים, מה שמאפשר לעבד מסמכים שלמים בלי לחתוך אותם לפסקאות קטנות מדי.

במדדי MTEB הוא מציג תוצאות חזקות במיוחד באימות עובדות וזיהוי שאלות כפולות, עם ציון NDCG של מעל 90 בבדיקות כמו FEVER ו־Quora. בחיפוש כללי ב־MSMARCO הוא עומד על ציון עיקרי של 45.7, ובנושאים פיננסיים ב־FiQA הוא מגיע ל־60.04. המספרים האלה מראים שהוא טוב מאוד באיתור הקשר מדויק, אבל בטקסטים מדעיים מורכבים כמו SCIDOCS הציון צונח לאזור ה־26.9.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    חלון של 8,192 טוקנים מאפשר להטמיע חוזים ודוחות מלאים לתוך וקטור אחד מדויק.

  • אימות טענות ומערכות RAG

    ציון NDCG של מעל 90 במדד FEVER מוכיח שהוא מאתר פסקאות רלוונטיות בדיוק יוצא דופן.

  • זיהוי שאלות כפולות במאגרים

    תוצאות מעולות במבחן Quora מסייעות לחבר בין ניסוחים שונים של אותה שאלה במערכות תמיכה.

איפה זה נופל

החיסרון הגדול ביותר הוא המשקל והאיטיות. 9.2 מיליארד פרמטרים למודל וקטורי זה צוואר בקבוק כבד מאוד בזמני תגובה, בטח מול חלופות קלות ומהירות. בנוסף, המבחנים מראים נפילה ברורה בידע מדעי ורפואי, כאשר ב־SCIDOCS הוא קיבל תוצאה נמוכה של 26.9 וב־TRECCOVID מדד ה־MAP שלו נמוך במיוחד. לא הייתי מכניס אותו למערכת של מאמרים אקדמיים לפני בדיקה יסודית על הדאטה הספציפי שלכם.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד לפיתוח מקומי?

לא באופן מעשי. הקבצים שוקלים מעל 34 גיגה בייט בדיוק מלא, ומחשב ללא כרטיס מסך חזק עם עשרות גיגות זיכרון ייעודי ייתקע מיד או יפעל בקצב איטי להחריד.

למה להשתמש במודל של 9 מיליארד פרמטרים רק בשביל אמבדינגס?

הגודל הזה נותן הבנה עמוקה של הקשר ויחסים מורכבים בטקסט שאף מודל של 300 מיליון פרמטרים לא מסוגל לתפוס. זה שווה את זה רק אם הדיוק בחיפוש קריטי למוצר שלכם.

איך מריצים

כדי להריץ אותו דרך ספריית sentence-transformers צריך חומרה רצינית מאוד. המודל שוקל 34.4 גיגה בייט בפורמט float32 וכולל 9.2 מיליארד פרמטרים, כך שכרטיס מסך ביתי רגיל פשוט יקרוס מחוסר זיכרון. תצטרכו שרת עם כרטיס מקצועי של 40 או 80 גיגה בייט VRAM רק כדי לטעון אותו ולבצע היקש במהירות סבירה.

אם אין לכם תשתית ענן ייעודית או צורך קריטי בפרטיות מידע מוחלטת בתוך הרשת המקומית, עדיף בהרבה לפנות ל־API חיצוני שמספק מודלים בגודל כזה. העלות והתחזוקה של שרת כזה עבור משימת הטמעה בלבד לא מצדיקות את עצמן ברוב הפרויקטים.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("BAAI/bge-multilingual-gemma2")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון gemma של גוגל. הרישיון הזה מתיר שימוש מסחרי, אבל הוא כולל תנאי שימוש ספציפיים והגבלות על סוגי יישומים מסוימים, בעיקר סביב שימושים מזיקים או אסורים. אם אתם מתכננים לשלב אותו במוצר מסחרי, אתם חייבים לעמוד בהנחיות השימוש המקובל של גוגל, לשמור על תאימות למדיניות הבטיחות שלהם, ולוודא שהמוצר שלכם אינו מפר את הסכם הרישוי המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗