GPT
G

gte-base-zh

קוד פתוח

thenlpermit2023-11-08

  • sentence-transformers
  • pytorch
  • safetensors
  • bert
  • mteb

מודל שיבוץ קומפקטי שמיועד לטקסטים בסינית, עם ביצועים מעולים באיתור מידע ודירוג מחדש. תרצו אותו אם אתם בונים חיפוש סמנטי למסמכים בסינית וצריכים ריצה מקומית מהירה וזולה.

  • 102Mפרמטרים
  • 512טוקנים בהקשר
  • 391 MBמשקל הקבצים
  • 3,933הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת BERT עם 12 שכבות שמייצר וקטורים להשוואת משפטים, סיווג ואחזור מידע. למרות שתגית השפה המוצהרת בקובץ היא אנגלית, כל מבחני הביצועים והשם שלו מעידים שהוא נבנה ונמדד ישירות על משימות בסינית.

במדדי C-MTEB הוא מציג תוצאות חזקות מאוד באחזור ודירוג. במבחני T2Retrieval ו־DuRetrieval הוא מגיע ל־MRR מעל 90 בעשירייה הראשונה, ובדירוג שאלות רפואיות כמו CMedQAv2 הוא מגיע ל־MAP של 87.2. המשמעות היא שבמשימות חיפוש מבוסס דמיון, התשובה הנכונה כמעט תמיד תצוף למעלה כבר בתוצאות הראשונות.

מצד שני, בסיווג טקסט כללי התוצאות מעורבות. בסקירות קניות הוא מדייק בלמעלה מ־93 אחוז, אבל במשימות סיווג כמו חדשות TNews הוא נעצר על 53.6 אחוז וב־Amazon Reviews על 45.8 אחוז, כך שהוא לא מתאים כפתרון גורף לכל משימת NLP.

מתאים ל

  • מנוע חיפוש מסמכים בסינית

    משיג MRR של מעל 90 באחזור טקסטים, ומאתר קטעים רלוונטיים במהירות.

  • דירוג מחדש למערכות RAG

    מצטיין בסידור תשובות רפואיות עם MAP מעל 87 במבחני CMedQA.

  • ניתוח חוות דעת מוצרים

    מגיע ל־93.3% דיוק בסיווג ביקורות קניות מקוונות בסינית.

איפה זה נופל

הבעיה המרכזית היא חלון ההקשר, שמוגבל ל־512 טוקנים. אם אתם מנסים לאנדקס מסמכים ארוכים, תצטרכו לחתוך אותם לפסקאות קצרות כדי לא לאבד תוכן. בנוסף, במשימות פרפרזה עדינות כמו PAWSX הוא קיבל ציון נמוך מאוד של כ־28 נקודות, ובדירוג MMarcoReranking הגיע ל־MRR של 26.6 בלבד, מה שמראה שהוא מתקשה בהבדלה בין ניסוחים מתעתעים או בתרגומים מסוימים.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל נבנה ונבדק על השפה הסינית בלבד, ובמטא־דאטה מסומן באנגלית. אין לו יכולת הבנה של טקסטים בעברית, וניסיון להשתמש בו עבור שאילתות מקומיות יחזיר שיבוצים חסרי משמעות.

איזו חומרה צריך כדי להריץ אותו בפרודקשן?

בגלל גודל של 102 מיליון פרמטרים ומשקל קובץ של 391 מגה בייט, הוא רץ בקלות על כל מעבד סטנדרטי בלי GPU ייעודי. שרת זול עם שני ליבות ו־2 גיגה זיכרון יספיק לעומסי עבודה סבירים.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers או Transformers הרגילה בפייתון. הקבצים שוקלים 391 מגה בייט בלבד, כך שהמשקל שלו בזיכרון זניח לחלוטין.

אפשר להריץ אותו בלי שום בעיה על מעבד רגיל בכל שרת פשוט, או על כרטיס מסך בסיסי עם פחות מגיגה זיכרון פנוי כדי לקבל זמני תגובה של מילישניות. אין סיבה לשלם לספק ענן חיצוני על API של שיבוצים כשמודל בגודל הזה עובד מקומית בקלות ובחינם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("thenlper/gte-base-zh")
v = m.encode(["שלום עולם"])

הרישיון

רישיון MIT פתוח לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור או להריץ אותו בשרתים שלכם בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗