GPT
S

sentence-bert-base-ja-mean-tokens-v2

קוד פתוח

sonoisacc-by-sa-4.02022-03-02

  • sentence-transformers
  • pytorch
  • safetensors
  • bert
  • sentence-bert

מודל Sentence-BERT ייעודי ליפנית שמייצר וקטורים למשפטים. מתאים למי שבונה חיפוש סמנטי או קלאסטרינג ביפנית ומחפש מודל קל משקל בלי שפות מיותרות ברקע.

  • 111Mפרמטרים
  • 512טוקנים בהקשר
  • 844 MBמשקל הקבצים
  • 109,435הורדות בחודש

מה זה

מדובר במודל שנועד למשימה אחת בלבד, חילוץ וקטורים מטקסטים ביפנית. הוא מבוסס על המודל היפני cl-tohoku עם whole word masking, ומחזיר ייצוג וקטורי ממוצע ברמת המשפט. הגרסה הזו נבנתה כשיפור לגרסה הראשונה באמצעות פונקציית הפסד מסוג MultipleNegativesRankingLoss, שמחדדת את ההפרדה בין משפטים דומים ללא דומים.

המפתח מדווח שהשינוי הזה הניב שיפור של 1.5 עד 2 נקודות בדיוק לעומת גרסה 1, אם כי הבדיקה נעשתה על דאטה-סט פרטי שלא פורסם. עם 111 מיליון פרמטרים וארכיטקטורת BERT סטנדרטית, הוא מתמקד רק ביפנית ולכן לא סוחב משקל עודף של מודלים רב לשוניים כבדים.

מתאים ל

  • חיפוש סמנטי ביפנית

    מאפשר לשלוף מסמכים ומשפטים לפי משמעות ולא לפי מילות מפתח מדויקות.

  • חלוקה לקבוצות תוכן

    מייצר וקטורים איכותיים לקיבוץ פניות תמיכה או מאמרים ביפנית לפי נושאים.

  • השוואת דמיון בין משפטים

    מזהה כפילויות של משפטים וביטויים מבוססי משמעות על בסיס חישוב מרחק וקטורי.

איפה זה נופל

הוא מוגבל ל־512 טוקנים ולא יתאים לטקסטים ארוכים בלי חיתוך מראש. הוא מיועד ליפנית בלבד ולא מבין עברית או אנגלית. מעבר לכך, נתוני המדידה שפורסמו מבוססים על דאטה פרטי, כך שאין מבחן ביצועים פומבי לבדיקת ההבטחה לשיפור בדיוק.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית או באנגלית?

לא. המודל אומן ספציפית על טקסטים ביפנית ומסתמך על טוקנייזר ייעודי לשפה זו. כל ניסיון להזין שפות אחרות יחזיר וקטורים חסרי משמעות.

מה נדרש להוסיף לסביבת הפיתוח כדי להפעיל אותו?

מלבד ספריית sentence-transformers הבסיסית, חובה להתקין את fugashi ואת ipadic דרך pip. בלעדיהם הטוקנייזר של cl-tohoku לא יוכל לפרק את המילים ביפנית והקוד ייכשל.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers, אבל חייבים להתקין מראש את fugashi ו־ipadic בשביל הטוקניזציה של השפה היפנית. המשקל שלו עומד על 844 מגה-בייט, כך שהוא רץ בלי מאמץ על כל מעבד מודרני או כרטיס מסך בסיסי עם מעט זיכרון.

אם אתם צריכים רק וקטורים פה ושם, שירות ענן חיצוני עשוי לחסוך תחזוקת תלויות, אבל בנפחי עבודה רציפים ביפנית הגודל הקומפקטי שלו הופך הרצה מקומית לפשוטה וזולה מאוד.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("sonoisa/sentence-bert-base-ja-mean-tokens-v2")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ ברישיון cc-by-sa-4.0. מותר להשתמש בו לצרכים מסחריים ופרטיים ולשנות אותו, אבל כל נגזרת או הפצה של המודל מחייבת מתן קרדיט ושיתוף באותו רישיון בדיוק. למערכות סגורות לחלוטין זה עשוי ליצור מגבלה משפטית.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗