GPT
G

gte-large-en-v1.5

קוד פתוח

Alibaba-NLPapache-2.02024-04-20

  • transformers
  • onnx
  • safetensors
  • new
  • feature-extraction

זה מודל לחישוב וקטורים ודמיון טקסטואלי באנגלית שמחזיק קלט ארוך פי שישה עשר מרוב מודלי ה־BERT הישנים. הוא נותן פתרון חזק למי שרוצה לאנדקס מסמכים שלמים בלי לקצוץ אותם לחתיכות קטנות.

  • 434Mפרמטרים
  • 8,192טוקנים בהקשר
  • 6.0 GBמשקל הקבצים
  • 960,309הורדות בחודש

מה זה

מדובר במודל ייעודי להשוואת טקסטים, חיפוש סמנטי, מיון וקיבוץ באנגלית, שאומן על נתוני c4 ומבוסס על 24 שכבות. הייחוד העיקרי שלו מול מודלי בסיס ותיקים הוא התמיכה בטקסטים ארוכים, מה שחוסך את הצורך לפרק חוזים או מאמרים לפסקאות בודדות בזמן החיפוש.

התוצאות במבחני הביצועים מראות פערים ברורים בין סוגי המשימות. בסיווג פשוט כמו זיהוי סנטימנט בביקורות אמזון הוא פוגע ב־93.97% דיוק, אבל במשימות מורכבות יותר של ביקורות רב־תחומיות הוא צונח ל־54.19%. באחזור מידע טכני בפורומים של מפתחים, מדד הדיוק הממוצע בתוצאה הראשונה עומד סביב 25 עד 30 אחוז בלבד, מה שאומר שבמערכות חיפוש אי אפשר להסתמך על התוצאה הראשונה שלו וצריך להביא כמה תוצאות קדימה.

מתאים ל

  • אינדוקס מסמכים ארוכים

    מאפשר לעבד מאמרים ודוחות באנגלית בשלמותם בזכות חלון קלט רחב, בלי לחלק אותם לחלקים קטנים.

  • סינון ומיון ביקורות

    מתאים לזיהוי קוטביות וסנטימנט בטקסטים צרכניים באנגלית, משימה שבה הוא מציג דיוק של כמעט 94 אחוז.

  • חיפוש סמנטי לשאלות ותשובות

    טוב לאיתור שאלות כפולות במאגרי ידע טכניים באנגלית, כל עוד מציגים למשתמש מספר תוצאות מובילות.

איפה זה נופל

הבעיה המרכזית שלו היא התמקדות באנגלית בלבד. הוא לא מאומן לעברית, ואם תנסו להזין לו טקסט מקומי תקבלו ייצוגים לא מדויקים שיפגעו בחיפוש. בנוסף, הארכיטקטורה מוגדרת כמודל מותאם אישית ולא סוג סטנדרטי, מה שעשוי לדרוש הרצת קוד חיצוני בטעינה. בנושאי אחזור מורכבים במדעים מדויקים כמו מתמטיקה הוא מציג תוצאות חלשות מאוד של 15.76% דיוק בתוצאה הראשונה.

שאלות
נפוצות

האם הוא יעבוד טוב על מאגר מסמכים בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד. הרצה של טקסט בעברית תייצר תוצאות לא אמינות בחיפוש ובסיווג, ועבור תוכן מקומי כדאי לחפש מודל רב־לשוני ייעודי.

כמה זיכרון חומרה צריך בשביל להריץ אותו בעבודה שוטפת?

הקבצים שוקלים שישה גיגה־בייט בדיוק המקורי. להרצה יציבה עם קלטים ארוכים מומלץ כרטיס מסך עם 12 עד 16 גיגה־בייט זיכרון, כדי שלא להיתקל בשגיאות מחסור במקום בזמן עיבוד מקבילי.

איך מריצים

המשקל הכולל של הקבצים מגיע לשישה גיגה־בייט בדיוק מלא של float32. כדי לטעון אותו ולהריץ חישוב וקטורים בזמן סביר תצטרכו כרטיס מסך עם לפחות שמונה עד שישה עשר גיגה־בייט זיכרון ייעודי, במיוחד אם אתם מתכוונים לנצל את כל האורך של הטקסט ולשלוח באצ'ים גדולים.

אפשר להריץ אותו מקומית בספריית transformers הרגילה של פייתון או דרך transformers.js בסביבות תואמות. אם התשתית שלכם יושבת על מעבדים בלבד בלי כרטיס גרפי, או שהעומס מגיע בגלים לא צפויים, החזקת שרת ייעודי בגודל הזה תעלה יותר מקריאה לשירות מנוהל חיצוני.

from transformers import pipeline

pipe = pipeline("sentence-similarity", model="Alibaba-NLP/gte-large-en-v1.5")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗