GPT
G

gte-small

קוד פתוח

thenlpermit2023-07-27

  • sentence-transformers
  • pytorch
  • tf
  • coreml
  • onnx

מודל שיכוך טקסט קליל באנגלית שמיועד להפקת וקטורים במהירות גבוהה. בוחרים בו כשרוצים חיפוש סמנטי מקומי בלי לשלם על כרטיסי מסך כבדים.

  • 33Mפרמטרים
  • 512טוקנים בהקשר
  • 766 MBמשקל הקבצים
  • 1,061,404הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת ברט עם שתים עשרה שכבות בלבד, שמייצר וקטורים להשוואת משפטים ומסמכים קצרים. הוא פועל באנגלית בלבד ומכוון בדיוק לנקודה שבה צריך דיוק סביר בלי לשלם את המחיר החישובי של מודלים ענקיים. ספריות sentence-transformers טוענות אותו ישירות, והוא נכנס כמעט לכל פייפליין קיים בלי התאמות מיוחדות.

במבחני ביצועים של MTEB רואים את החוזק שלו במשימות סיווג ודמיון טקסטואלי ישיר, כמו במבחן BIOSSES שבו הוא מגיע למתאם פירסון של מעל 89. לעומת זאת, במשימות אחזור מורכבות בעולמות טכניים ספציפיים, למשל מבחן המתמטיקה של CQADupstack, הדיוק הראשוני בצמרת התוצאות צונח לכ־20.8 במדד NDCG@1. זה אומר שהוא מבין הקשר כללי מצוין, אבל יתקשה לדייק כשהניואנסים הופכים למקצועיים מאוד.

מתאים ל

  • חיפוש סמנטי מהיר באנגלית

    שליפת מסמכים קצרים לפי משמעות כשיש שרת עם משאבי מעבד מוגבלים.

  • סיווג טקסטים וסנטימנט

    מיון ראשוני של ביקורות או פניות משתמשים באנגלית בדיוק שמגיע למעל 90 אחוז.

  • סינון כפילויות במאגרי שאלות

    זיהוי שאלות דומות בפורומים תמיכה טכניים בעזרת ציוני דמיון וקטוריים גבוהים.

איפה זה נופל

הוא מוגבל לחלון הקשר של 512 טוקנים, כך שטקסטים ארוכים ייחתכו או ידרשו פירוק מוקדם לפסקאות. בנוסף, הוא תומך באנגלית בלבד, ואינו מתאים לחומרים בעברית. במשימות סיווג ביקורות עם דירוג מורכב הוא מציג דיוק של כ־48 אחוז בלבד, מה שמחייב לבדוק אותו על הנתונים שלכם לפני שסומכים עליו בעיניים עצומות.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות על המחשב האישי בלי כרטיס מסך?

כן, המודל כולל 33 מיליון פרמטרים בלבד ושוקל פחות מגיגה־בייט. הוא רץ היטב על כל מעבד מודרני בלי להעמיס על זיכרון המחשב.

האם הוא יזהה טקסטים בעברית?

לא, המודל אומן ותועד עבור השפה האנגלית בלבד. אם תזינו לו עברית, תקבלו תוצאות גרועות מאוד או וקטורים חסרי משמעות.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בפייתון עם מזהה המודל thenlper/gte-small. עם משקל של 766 מגה־בייט ו־33 מיליון פרמטרים בדיוק float16, מעבד רגיל של שרת פשוט מריץ אותו בלי שום בעיה. אין כאן חובה לכרטיס מסך ייעודי בסביבת ייצור, אלא אם יש לכם קצב תעבורה חריג.

בגודל כזה ממש אין סיבה לשלם לספקי ענן על קריאות API חיצוניות. הניהול העצמי שלו זול, לא מייצר תלות ברשת חיצונית, ושומר על המידע שלכם מקומית בלי סיבוכים מיותרים.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("thenlper/gte-small")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ תחת רישיון MIT. המשמעות פשוטה, מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו חופשי, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗