GPT
G

gte-base

קוד פתוח

thenlpermit2023-07-27

  • sentence-transformers
  • pytorch
  • onnx
  • safetensors
  • openvino

מודל שיודע לייצר וקטורים מדויקים ממשפטים באנגלית לצורכי חיפוש וסיווג. הוא שוקל מעט ורץ מהר על מעבד רגיל, בלי להזדקק לכרטיסי מסך כבדים.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 203,940הורדות בחודש

מה זה

מדובר במודל וקטורי מבוסס ארכיטקטורת ברט עם שתים עשרה שכבות, שתוכנן למשימות של דמיון בין טקסטים ושליפת מידע. הוא קורא קטעי טקסט וממיר אותם למרחב שבו משפטים בעלי משמעות דומה נמצאים קרוב זה לזה. התוצאה היא כלי עבודה נוח למערכות חיפוש טקסטואליות, קיבוץ מסמכים ומיון נתונים.

במבחני הביצועים של לוח התוצאות, המודל מציג פערים ברורים בין סוגי המשימות. בסיווג פולאריות של ביקורות הוא פוגע בלמעלה מתשעים ואחד אחוזי דיוק, ובדירוג מחדש של שאלות טכניות הוא מגיע למדד של כמעט שבעים וחמישה אחוזים. לעומת זאת, במשימות אחזור מורכבות יותר מתוך מאגרי שאלות ותשובות, הדיוק הראשוני בצמרת התוצאות צונח לאזור עשרים עד ארבעים אחוזים בלבד. המשמעות היא שהוא מצטיין בזיהוי כוונות ודמיון סמנטי ישיר, אבל מתקשה כשנדרשת שליפה חד משמעית של תשובה בודדת מתוך מאגר טכני עמוס.

מתאים ל

  • חיפוש סמנטי באנגלית

    הוא מזהה שאלות דומות ומשפטים חופפים באנגלית בדיוק גבוה, ומחזיר מסמכים רלוונטיים במהירות.

  • סיווג ביקורות מוצר

    הוא השיג מעל תשעים ואחד אחוזי דיוק במבחני סנטימנט, ולכן הוא בחירה טבעית למיון פידבקים.

  • דירוג מחדש של תוצאות

    הוא מקבל ציון גבוה בסידור שאלות טכניות כפולות, מה שמתאים לשיפור שלב שני במנועי חיפוש.

איפה זה נופל

המגבלה המרכזית היא השפה. המודל אומן על אנגלית בלבד, ואם תזינו לו עברית תקבלו וקטורים חסרי פשר. בנוסף, חלון ההקשר מוגבל לחמש מאות ושנים עשר טוקנים, כך שהוא עיוור למסמכים ארוכים אם לא חותכים אותם מראש. במשימות שליפה מורכבות במתמטיקה הוא מציג תוצאות חלשות מאוד, עם מדד דיוק ראשוני של פחות משמונה עשרה אחוזים. אם המערכת שלכם נשענת על ניסוחים טכניים מסובכים, תצטרכו להסתמך על שלב סינון נוסף.

שאלות
נפוצות

האם אפשר להשתמש בו לחיפוש מסמכים בעברית?

לא, המודל אומן על נתונים באנגלית בלבד. אם תזינו לו טקסט בעברית, הייצוג הוקטורי יהיה משובש ולא אמין. לפרויקט ישראלי תצטרכו לחפש מודל רב לשוני ייעודי.

האם הוא מתאים לחיפוש בתוך חוזים ומאמרים ארוכים?

רק אם תפרקו אותם לפסקאות קצרות קודם לכן. חלון ההקשר שלו מוגבל לחמש מאות ושנים עשר טוקנים, ולכן הוא לא יכול לקרוא מסמך שלם ברצף אחד.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בפייתון. הקבצים שוקלים כגיגה וחצי, כך שאין צורך במערך שרתים מורכב. כל מעבד מודרני ממוצע יכול להריץ אותו בהספק סביר, ואם יש לכם כרטיס גרפי פשוט עם שתי גיגה זיכרון, תקבלו קצב המרה גבוה מאוד.

משתלם להרים אותו לבד אם אתם מעבדים נפחים קבועים של טקסט בתוך הרשת הפנימית ורוצים להימנע מחיובים חודשיים. מצד שני, אם יש לכם קפיצות תנועה חריגות ואינכם רוצים לתחזק שרת פייתון באוויר עשרים וארבע שעות ביממה, שירות ענן חיצוני יחסוך כאב ראש.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("thenlper/gte-base")
v = m.encode(["שלום עולם"])

הרישיון

רישיון פתוח לחלוטין מסוג MIT. אתם חופשיים להשתמש בו במוצרים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו בקוד סגור. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים של היוצר המקורי בתוך קבצי הפרויקט שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗