GPT
M

m3e-large

קוד פתוח

moka-aiרישיון לא דווח2023-06-21

  • sentence-transformers
  • pytorch
  • bert
  • embedding
  • text-embedding

מודל וקטורי עם 340 מיליון פרמטרים שמתמחה בטקסט סיני ומדורג גבוה במשימות סיווג וחיפוש. מי שעובד עם סינית יקבל כאן איכות שמנצחת מודלים קנייניים.

  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 2,745הורדות בחודש
  • 224לייקים

מה זה

המודל הזה אומן על יותר מ־22 מיליון זוגות משפטים בסינית, עם תוספת של 1.45 מיליון שלשות באנגלית ו־3 מיליון דוגמאות של הוראות. הוא מבוסס על Roberta של מעבדת hfl, מכיל 24 שכבות ופולט וקטורים בגודל 768 ממדים. המטרה של היוצרים היתה לכסות גם השוואת משפטים ישירה וגם שליפת פסקאות מתוך שאילתות קצרות.

במבחני סיווג טקסט בסינית הוא מוביל מול שאר גרסאות הסדרה עם דיוק ממוצע של 0.6231, מעל openai-ada-002 שעומד על 0.5956. לעומת זאת, בשליפת פסקאות על T2Ranking 1W הוא רושם ndcg@10 של 0.7974, שזה מעט מתחת לגרסת ה־base של אותה סדרה שמגיעה ל־0.8004. השיפור בסיווג קיים, אבל הוא לא בהכרח שווה את המשקל הנוסף לעומת גרסת ה־base אם המטרה העיקרית שלכם היא מנוע חיפוש.

מתאים ל

  • סיווג טקסטים בסינית

    הוא השיג דיוק ממוצע של 0.6231 על שישה מאגרי סיווג, התוצאה הגבוהה ביותר מבין כל המודלים שנבדקו.

  • חיפוש סמנטי מקומי בסינית

    טוב למערכות RAG שרצות בתוך הרשת הארגונית וחייבות דיוק גבוה בסינית בלי להוציא מידע החוצה.

  • מערכות זיהוי כפילויות

    האימון על עשרות מיליוני זוגות משפטים נותן לו יכולת טובה לזהות ניסוחים שונים של אותה שאלה בסינית.

איפה זה נופל

המודל הזה לא מתאים לעברית. אין לו שום תמיכה בשפה, ובטבלאות המפתחים מופיע במפורש שהוא מיועד לסינית בלבד עם תמיכה מוגבלת באנגלית. חלון ההקשר מוגבל ל־512 טוקנים, מה שפוסל אותו לעיבוד מסמכים ארוכים ללא פירוק מוקדם לחתיכות קטנות.

הוא גם לא יודע לחפש קוד מקור, יכולת שהיוצרים הגדירו כתוכנית עתידית שלא מומשה בגרסה הזו. בנוסף, למרות הגודל שלו, הוא לא מנצח את גרסת ה־base במשימות שליפה.

שאלות
נפוצות

האם כדאי להעדיף את גרסת ה־large על פני גרסת ה־base?

ברוב המקרים לא. גרסת ה־large מובילה בקצת במשימות סיווג עם 0.6231 לעומת 0.6157, אבל בשליפת פסקאות גרסת ה־base עוקפת אותה עם 0.8004 לעומת 0.7974, תוך שימוש בשליש מכמות הפרמטרים.

האם המודל תומך בעברית או באנגלית?

בעברית הוא לא תומך כלל. באנגלית הוא אומן על סט נתונים של 1.45 מיליון שלשות, אך המפתחים מציינים בפירוש בטבלה הראשית שהגרסה הזו מיועדת לסינית, וממליצים עליה רק לתרחישים של סינית עם מעט אנגלית.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers עם מזהה המודל. הקבצים שוקלים 1.2 גיגה בייט בדיוק float32, כך שכל כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון מריץ אותו בלי שום בעיה. אפשר גם לעבוד על מעבד רגיל, אבל בנפחי טקסט גבוהים תרגישו את האיטיות.

גרסת ה־large גדולה פי שלושה מגרסת ה־base, שמכילה 110 מיליון פרמטרים, ולא מציגה פער ביצועים משמעותי שמצדיק את צריכת הזיכרון בכל תרחיש. שווה להחזיק אותו על תשתית שלכם כשאתם מחויבים לפרטיות של מידע פנימי, אבל אם המערכת שלכם כבר מחוברת ל־API חיצוני וצריכה לתמוך גם בשפות אחרות, השירותים המוכנים יחסכו תחזוקת שרת.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("moka-ai/m3e-large")
v = m.encode(["שלום עולם"])

הקבצים

8 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הרשמי לא הוזן במטא-דאטה, אבל בתוך דף התיעוד היוצרים מבהירים במפורש שהמודל מיועד למחקר בלבד ואסור לשימוש מסחרי. הסיבה היא שהוא אומן על מאגרי מידע רבים שאינם מאושרים לשימוש מסחרי, כך שאי אפשר לשלב אותו במוצר עסקי.

הרישיון המלא בעמוד המודל ↗