GPT
G

gte-large-zh

קוד פתוח

thenlpermit2023-11-07

  • sentence-transformers
  • pytorch
  • safetensors
  • bert
  • mteb

מודל שיכוך ייעודי לסינית שמחזיר וקטורים מדויקים לאחזור טקסט ודירוג מחדש. הוא מתאים למי שבונה חיפוש סמנטי ומחפש ביצועים חזקים במיוחד בתחום הרפואי והמסחרי.

  • 326Mפרמטרים
  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 8,880הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת ברט עם עשרים וארבע שכבות, שמיועד למשימות דמיון בין משפטים ואחזור מידע. למרות שתגית השפה המוצהרת בקובץ היא אנגלית, כל מבחני הביצועים שלו נערכו על בנצ'מרק C-MTEB שמיועד לסינית, והסיומת של שמו מבהירה בדיוק מה קהל היעד האמיתי שלו. הוא מייצר ייצוגים וקטוריים של טקסטים כדי לאפשר חיפוש לפי משמעות ולא לפי מילות מפתח יבשות.

התוצאות במבחנים מראות פערים חדים מאוד בהתאם לתחום. באחזור מידע רפואי ובדירוג תשובות לשאלות בריאות הוא מגיע למדדי דיוק מרשימים, כמו MRR של מעל 88 נקודות, וגם באחזור כללי כמו DuRetrieval הדיוק הראשוני שלו גבוה מאוד עם MRR שעובר את ה־92. לעומת זאת, במשימות סיווג סנטימנט מסחרי או זיהוי כוונות הוא מתקשה יותר ומציג ציונים סביב 47 עד 75 נקודות דיוק, מה שאומר שהוא מצטיין בעיקר בהבנת הקשר עמוק ושאילתות מורכבות.

מתאים ל

  • חיפוש סמנטי בסינית

    הוא מספק דיוק גבוה במיוחד בשאילתות טקסט כלליות ומסחריות.

  • דירוג מחדש לשאלות רפואיות

    המבחנים מציגים מעל 88 נקודות MRR במאגרי שאלות ותשובות רפואיים.

  • ניתוח וקיבוץ טקסטים

    הוא מגיע לתוצאות הפרדה טובות בקיבוץ כתבות חדשותיות.

איפה זה נופל

חלון ההקשר מוגבל לחלוטין ל־512 טוקנים, ולכן הוא לא מתאים לפסקאות ארוכות או למסמכים שלמים בלי שתפרקו אותם מראש למקטעים קטנים. מעבר לזה, במשימות דמיון טקסטואלי מסוימות כמו PAWSX ו־QBQTC הוא קיבל ציוני קורלציה נמוכים מאוד של 33 עד 38 נקודות, כך ששינויי ניסוח קלים עלולים להטעות אותו לגמרי. בנוסף, אין שום עדות ליכולת שלו לעבוד עם עברית.

שאלות
נפוצות

האם המודל תומך בעברית?

לא, המודל אומן ונבדק על סינית בלבד, והתיוג הטכני שמציין אנגלית שגוי או חלקי. לא הייתי מנסה להשתמש בו לטקסט עברי בשום מצב.

האם אפשר להריץ אותו על מעבד רגיל בלי כרטיס מסך?

כן, עם כ־326 מיליון פרמטרים מעבד מודרני מסוגל לחשב וקטורים בקצב סביר לטקסטים בודדים. אם יש לכם נפח שאילתות גדול, עדיף בכל זאת כרטיס מסך קטן.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית sentence-transformers הרגילה בפייתון, בדיוק כמו כל מודל דמיון סטנדרטי. עם משקל של 1.2 גיגהבייט ודיוק חצי צף, כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון יספיק לחלוטין כדי להחזיק אותו בזיכרון ולהריץ אצוות קטנות במהירות גבוהה.

אם אתם לא צריכים שיהוי של אלפיות שנייה או שאין לכם חומרה ייעודית בענן, שירותי אירוח חיצוניים שמחזיקים שרתי הסקה יכולים לחסוך תחזוקה. אבל בגלל המשקל הקל והעובדה שזה בסך הכול ברט, הרצה עצמית על שרת פנימי קטן היא זולה, פשוטה ולא מצדיקה תלות בספק חיצוני אם הפרטיות של המידע חשובה לכם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("thenlper/gte-large-zh")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ תחת רישיון MIT. זה אומר שמותר לכם להשתמש בו לצרכים מסחריים, להטמיע אותו במוצרים פנימיים או חיצוניים ולשנות את הקוד והמשקלים בחופשיות, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗