GPT
S

stella-mrl-large-zh-v3.5-1792d

קוד פתוח

dunzhangmit2024-02-27

  • sentence-transformers
  • pytorch
  • safetensors
  • bert
  • feature-extraction

מודל שיעבוד מעולה אם אתם בונים חיפוש סמנטי או RAG בסינית. הוא מפיק וקטורים רחבים ומציג דיוק גבוה מאוד בשליפת מידע ובדירוג מחדש.

  • 326Mפרמטרים
  • 512טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 117,643הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת BertModel עם 326 מיליון פרמטרים ו־24 שכבות, שמיועד לדמיון בין משפטים ומשימות שליפה. השם שלו מסגיר תמיכה בייצוג רב שכבתי, והגרסה הזו עובדת עם וקטור פלט רחב של 1792 ממדים, פי שניים ויותר מרוב מודלי הבסיס בקטגוריה הזו.

במדדי C-MTEB בסינית הוא מציג מספרים מרשימים במיוחד במשימות אחזור ודירוג. במבחן T2Retrieval הוא הגיע לציון MRR@1 של 91.18, ובמשימות סידור מחדש של שאלות ותשובות רפואיות כמו CMedQAv1 הוא עובר MRR של 91.3. המשמעות היא שבמערכות חיפוש, התוצאה הנכונה כמעט תמיד תופיע ראשונה.

מתאים ל

  • חיפוש סמנטי בסינית

    הוא מגיע לדיוק של מעל 90 במדדי החזרת תוצאה ראשונה בטקסטים מורכבים.

  • דירוג תוצאות רפואיות

    במבחני CMedQA הוא השיג מעל 89 בציון MAP, שמתאים לדיוק קליני.

  • שאלות ותשובות ממוקדות

    החלון הקצר של 512 טוקנים אידיאלי להתאמת שאילתה לפסקה רלוונטית.

איפה זה נופל

הבעיה הבולטת ביותר היא השפה. המודל מכויל ומאומן על בנצ'מרקים בסינית, ולא יתאים לטקסט בעברית או באנגלית בלי בדיקה מחמירה מראש. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים בלבד, מה שאומר שאי אפשר להזין אליו מסמכים שלמים בלי לחתוך אותם לפסקאות קצרות.

מעבר לכך, הביצועים שלו במשימות סיווג כלליות בינוניים למדי, עם דיוק של 46.59 בלבד על ביקורות אמזון ו־53 על TNews. אם אתם צריכים קלסיפיקציה ולא חיפוש, חבל לבזבז עליו משאבים.

שאלות
נפוצות

האם כדאי להשתמש בו לטקסטים בעברית?

לא. כל נתוני הבדיקה והאימון שלו שייכים ל־C-MTEB וממוקדים בשפה הסינית. לטקסט מקומי עדיף לקחת מודל רב־לשוני ייעודי.

למה ממד הווקטור כאן הוא 1792?

זהו גודל ייצוג רחב שנועד לשמור יותר פרטים סמנטיים בכל משפט. החיסרון הוא שבסיס הנתונים הווקטורי שלכם יצטרך להחזיק יותר זיכרון עבור כל רשומה.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בקוד פייתון רגיל. הקבצים שוקלים 2.4 גיגה בייט בפורמט float32, כך שכל כרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון יחזיק אותו בקלות לצד השרת שלכם, ואפשר להריץ אותו אפילו על מעבד רגיל אם העומס נמוך.

אין סיבה לשלם לספקי צד שלישי על API חיצוני כשהמשקל כל כך קטן. התקורה העיקרית שלכם תהיה דווקא בבסיס הנתונים הווקטורי, כי וקטורים של 1792 ממדים דורשים יותר זיכרון ונפח אחסון ממה שמקובל במודלים קטנים יותר.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("dunzhang/stella-mrl-large-zh-v3.5-1792d")
v = m.encode(["שלום עולם"])

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו בשרתים שלכם ולשלב אותו במוצר סגור, בלי תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים של היוצר המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗