GPT
J

jina-embeddings-v2-base-zh

קוד פתוח

jinaaiapache-2.02024-01-10

  • sentence-transformers
  • pytorch
  • onnx
  • safetensors
  • bert

יש כאן גם סקירה על Jina AI עצמו.

מודל וקטורי קומפקטי לסינית ואנגלית שבולט בזכות חלון קלט של 8,192 טוקנים. הוא נותן פתרון למי שצריך לאנדקס מסמכים שלמים בשפות האלה בלי לחתוך אותם לפסקאות קצרות.

  • 161Mפרמטרים
  • 8,192טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 36,348הורדות בחודש

מה זה

מדובר במודל מבוסס JinaBert עם 161 מיליון פרמטרים, שמתמקד בחילוץ מאפיינים וטקסט דו־לשוני בסינית ובאנגלית. רוב מודלי ה־BERT בגודל הזה מוגבלים לחלון קצר בהרבה, כך שהיתרון הבולט כאן הוא היכולת לעבד טקסטים ארוכים במיוחד בלי לפגוע בהקשר הרחב של המסמך.

במבחני C-MTEB הוא מציג תוצאות מעורבות. באחזור ודירוג מחדש הוא מגיע לציונים גבוהים, כמו MRR של 86.1 במאגר הרפואי CMedQA ושל 91.7 ב־DuRetrieval, שמעידים על דיוק חזק במציאת תשובות רלוונטיות. מצד שני, במשימות סיווג כמו ביקורות אמזון הוא מקבל דיוק של 34.94% בלבד, כך שלא הייתי בונה עליו לקטלוג אוטומטי מורכב.

מתאים ל

  • אחזור מידע ממסמכים בסינית

    הוא מגיע ל־MRR של מעל 91 במבחני שליפה בסינית ויודע לקרוא טקסטים ארוכים בבת אחת.

  • דירוג מחדש בתחום הרפואי

    עם ציון של 83.7 במדד MAP על CMedQAv2, הוא מתאים מאוד לסינון תוצאות חיפוש מקצועיות.

  • סיווג טקסטים קצרים מאתרי קניות

    במבחן ביקורות הקניות JDReview הוא השיג 79.5% דיוק, שמתאים למיון משובים בסינית.

איפה זה נופל

אם אתם מחפשים מודל שיטפל בעברית, דלגו הלאה. הוא אומן אך ורק על סינית ואנגלית, ואין לו מושג מה לעשות עם שפות שמיות. מעבר למגבלת השפה, תוצאות ה־STS שלו בחלק מהמבחנים נמוכות, למשל ציון פירסון של 35.4 בלבד ב־QBQTC ושל 37.5 ב־PAWSX, מה שאומר שהוא מתקשה בזיהוי ניואנסים עדינים של דמיון סמנטי במשפטים קצרים ומבלבל בין ניסוחים דומים שמשמעותם שונה לחלוטין.

שאלות
נפוצות

האם כדאי להשתמש בו לאחזור מסמכים בעברית?

לא. המודל תומך באנגלית ובסינית בלבד. ניסיון לייצר וקטורים לטקסט בעברית ייתן תוצאות גרועות מאוד ולא אמינות.

האם נדרש כרטיס מסך חזק כדי להריץ אותו?

ממש לא. המודל שוקל 1.6 גיגה־בייט ומכיל 161 מיליון פרמטרים. כל מחשב מודרני או שרת ענן פשוט יכולים להריץ אותו, אפילו על גבי מעבד.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.6 גיגה־בייט בדיוק של float16, כך שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בסיסי או אפילו על מעבד שרת סטנדרטי בלי לחנוק את הזיכרון. הטעינה נעשית ישירות דרך ספריית sentence-transformers, ומכיוון שמדובר בארכיטקטורת JinaBertModel, צריך לוודא שהסביבה שלכם תומכת בקוד המודל.

אפשר גם להריץ אותו בצד לקוח עם transformers.js בזכות המשקל הנמוך. אין צורך לשלם על API חיצוני כשמדובר במודל כזה קטן, אלא אם אתם מתמודדים עם תעבורה ענקית של מסמכים בני 8,000 טוקנים ולא רוצים לנהל את משאבי המחשוב בעצמכם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("jinaai/jina-embeddings-v2-base-zh")
v = m.encode(["שלום עולם"])

הרישיון

המודל שוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצר סגור בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗