GPT
T

text2vec-base-multilingual

קוד פתוח

shibing624apache-2.02023-06-22

  • sentence-transformers
  • pytorch
  • onnx
  • safetensors
  • bert

מודל שיבוץ קומפקטי של 118 מיליון פרמטרים שמיועד לקטור טקסטים קצרים בשמונה שפות מרכזיות, כולל סינית. הוא מתאים למי שחייב להריץ דמיון בין משפטים מקומית על מעבד רגיל ובלי תלות ברשת.

  • 118Mפרמטרים
  • 512טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 126,813הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת BERT עם 12 שכבות שממיר משפטים לווקטורים ומכוון למשימות של דמיון סמנטי, סיווג וחיפוש. הוא מאומן על נתוני NLI בסינית אך תומך גם באנגלית, גרמנית, צרפתית, איטלקית, הולנדית, פורטוגזית ופולנית, ומאפשר השוואה ישירה בין שפות שונות בתוך אותו מרחב וקטורי.

במבחני MTEB התוצאות שלו מעורבות. בסיווג כוונות הוא מציג דיוק סביר שנע סביב 50 עד 63 אחוז בשפות שונות, וסיווג תחומים באנגלית עומד על 81 אחוז. לעומת זאת, בסיווג ביקורות אמזון רב לשוני הוא קורס לדיוק של כ־30 עד 34 אחוז בלבד, מה שמראה שהוא מתקשה מאוד בניתוח סנטימנט או הבנת טקסט מורכב.

מתאים ל

  • זיהוי כוונות בצ'אטבוט

    ממיר שאלות משתמשים לווקטורים לצורך ניתוב מהיר מול תבניות קבועות.

  • סינון כפילויות תמיכה

    מוצא שאלות חופפות במאגרי ידע באנגלית או בסינית בדיוק סביר.

  • סיווג טקסטים מהיר

    משמש כשכבת וקטורים קלה למודלי סיווג פשוטים שרצים על מעבד רגיל.

איפה זה נופל

החלון מוגבל ל־512 טוקנים, ולכן הוא לא מתאים לפסקאות ארוכות או למאמרים. הבעיה העיקרית למפתח ישראלי היא שהרשימה הרשמית לא כוללת עברית, ולמרות שבמבחן massive intent נרשם דיוק של 51 אחוז בעברית, לא הייתי בונה עליו למוצר מקומי בלי בדיקה יסודית. מעבר לכך, התוצאות שלו בקלאסטרינג ודירוג מחדש נמוכות, עם מדדי v-measure שנעים סביב 23 עד 32 נקודות.

שאלות
נפוצות

האם אפשר להשתמש בו לחיפוש סמנטי בעברית?

רשמית הוא לא תומך בעברית, למרות שיש לו ביצועים בסיסיים של 51 אחוז במבחן Massive. אם המוצר שלכם פונה לשוק המקומי, עדיף לבחור מודל ייעודי לעברית או מודל רב לשוני גדול בהרבה.

האם חובה להחזיק כרטיס מסך כדי להריץ אותו?

ממש לא. הוא שוקל רק 1.4 גיגה בייט ומכיל 118 מיליון פרמטרים, מה שמאפשר להריץ אותו על מעבד רגיל בשרת פשוט או במחשב נייד בזמני תגובה של מילישניות בודדות.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בפייתון בשתי שורות קוד, בלי צורך בהגדרות מיוחדות. המשקל הכולל של הקבצים עומד על 1.4 גיגה בייט בדיוק של float32, כך שכל מעבד מודרני מריץ אותו בקלות בלי לחשוב בכלל על כרטיס מסך ייעודי.

אם יש לכם שרת מקומי עם מעט זיכרון עבודה, הוא יעבוד שם חלק לגמרי. תעברו לשירות ענן בתשלום רק אם אתם צריכים לטפל במסמכים ארוכים או בעברית, כי המודל הזה לא נבנה עבורם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("shibing624/text2vec-base-multilingual")
v = m.encode(["שלום עולם"])

הרישיון

רישיון apache-2.0 חופשי לחלוטין. מותר להשתמש בו במוצרים מסחריים, לשנות את המשקלים ולהפיץ אותו הלאה בחינם או בתשלום. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗