GPT
M

m3e-base

קוד פתוח

moka-aiרישיון לא דווח2023-06-06

  • sentence-transformers
  • pytorch
  • safetensors
  • bert
  • embedding

מודל שיבוץ קומפקטי לסינית עם תמיכה באנגלית, שנבנה לחיפוש ולהתאמת טקסטים. הוא מתאים למי שצריך לאחזר מסמכים בסינית מקומית בלי לשלם על קריאות שרת.

  • 102Mפרמטרים
  • 512טוקנים בהקשר
  • 781 MBמשקל הקבצים
  • 206,178הורדות בחודש

מה זה

המודל מתבסס על ארכיטקטורת ברט עם 102 מיליון פרמטרים, ומייצר וקטורים בגודל 768 ממדים. היוצרים שלו אימנו אותו על מעל 22 מיליון צמדי משפטים בסינית מתחומים כמו משפט, רפואה וכלכלה, לצד כמעט מיליון וחצי שלשות באנגלית. בניגוד לחלק ממודלי השיבוץ בגודל הזה שמתמחים רק בהשוואת משפט מול משפט זהה במבנהו, הוא אומן גם למשימות אחזור של שאילתה קצרה מול פסקה ארוכה.

במדדי ההשוואה של היוצרים על מערך T2Ranking הסיני, הוא קיבל ציון של 0.8004 במדד ndcg@10 לעומת 0.7786 של המודל ada-002 מבית OpenAI. בסיווג טקסט הוא הציג דיוק ממוצע של 0.6157 על פני שישה מאגרי נתונים. בפועל, המשמעות היא יכולת הפרדה טובה מאוד בין פסקאות רלוונטיות ללא רלוונטיות בטקסטים סיניים, בלי צורך במודל ענק.

מתאים ל

  • אחזור מסמכים בסינית

    הוא מציג ביצועי דיוק גבוהים בהתאמת שאילתות קצרות לפסקאות מידע שלמות בסינית.

  • מיון וסיווג טקסטים

    הוא מספק וקטורים יציבים למשימות קלסיפיקציה של ביקורות וחדשות בסינית ובאנגלית.

  • זיהוי כפילויות שאלות

    הוא אומן על מיליוני צמדים לזיהוי דמיון סמנטי בין משפטים ומאתר ניסוחים מקבילים.

איפה זה נופל

הבעיה המרכזית עבור מפתח ישראלי היא היעדר מוחלט של תמיכה בעברית. המודל אומן על סינית ואנגלית בלבד, ואם תזינו לו טקסט מקומי תקבלו שיבושים חסרי משמעות. מגבלה טכנית נוספת היא חלון הקשר של 512 טוקנים, מה שאומר שאי אפשר לשלוח מסמכים מלאים בלי לחתוך אותם לחתיכות קטנות מראש. בנוסף, הכרטיס מציין במפורש שהמודל לא תומך באחזור קוד תוכנה, ואיכות החיפוש שלו יורדת בחדות ככל שמאגר המסמכים גדל מעבר לעשרות אלפי פריטים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לחיפוש סמנטי בעברית?

לא. המודל אומן אך ורק על סינית ומעט אנגלית. אין לו יכולת לנתח מבנה של משפטים בעברית והווקטורים שהוא ייצר עבורם יהיו חסרי ערך.

האם הוא מתאים למוצר מסחרי שפונה לשוק הסיני?

מבחינת ביצועים הוא עובד מצוין, אבל מבחינה משפטית היוצרים אוסרים שימוש מסחרי. תצטרכו לאמן מודל משלכם על בסיס הנתונים החופשיים בלבד.

איך מריצים

כדי להריץ אותו מתקינים את sentence-transformers וטוענים את המשקלים ישירות בקוד פייתון. הקבצים שוקלים 781 מגה בייט, כך שכל כרטיס מסך בסיסי או אפילו מעבד רגיל בשרת פשוט מריצים אותו בלי שום מאמץ, בלי צורך בחומרה ייעודית כבדה.

היוצרים שחררו גם גרסת small קטנה יותר עם 24 מיליון פרמטרים, אבל היא מוגבלת לסינית בלבד ואינה מיועדת לאחזור פסקאות. אם אתם מעבדים בעיקר שפות מערביות או זקוקים לחיפוש קוד, עדיף להשתמש בפתרונות ענן רב-לשוניים ולא להחזיק אותו על תשתית שלכם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("moka-ai/m3e-base")
v = m.encode(["שלום עולם"])

הרישיון

למרות שלא הוגדר רישיון רשמי במטא-דאטה, היוצרים כותבים בפירוש בטקסט שהמודל מיועד למחקר בלבד ואסור לשימוש מסחרי. הסיבה היא שהוא אומן על מאגרי נתונים שכללו מידע ברישיונות מגבילים. אם אתם בונים מוצר שמייצר הכנסות או מיועד לחברה, אסור לשלב אותו בקוד.

הרישיון המלא בעמוד המודל ↗