GPT
U

UAE-Large-V1

קוד פתוח

WhereIsAImit2023-12-04

  • sentence-transformers
  • onnx
  • safetensors
  • openvino
  • bert

מודל שיעבוד מעולה לחיפוש סמנטי, דירוג מחדש וסיווג טקסטים באנגלית. הוא מביא ביצועים חזקים מאוד במבחני MTEB ביחס לגודל קומפקטי יחסית.

  • 335Mפרמטרים
  • 512טוקנים בהקשר
  • 5.0 GBמשקל הקבצים
  • 1,248,561הורדות בחודש

מה זה

מדובר במודל וקטורי מבוסס ארכיטקטורת ברט עם עשרים וארבע שכבות ודיוק מלא. המטרה המרכזית שלו היא המרת קטעי טקסט לוקטורים לצורכי חיפוש, קלאסטרינג וסיווג, כשהוא נשען על ספריית sentence-transformers המוכרת.

במבחני MTEB הרשמיים הוא מציג מספרים מרשימים במיוחד במשימות סיווג ודמיון סמנטי. בסיווג פולאריות של ביקורות אמזון הוא פוגע בדיוק של מעל 92 אחוז, ובמשימת דמיון טקסטים רפואיים כמו BIOSSES הוא מגיע למתאם ספירמן של 86. הוא גם מתמודד בצורה יציבה עם משימות אחזור מורכבות מקבוצת CQADupstack, מה שאומר שהוא יודע לזהות כוונת משתמש ושאלות כפולות ברמה גבוהה.

מתאים ל

  • מנוע חיפוש סמנטי באנגלית

    מצטיין באחזור שאלות ותשובות טכניות ומספק תוצאות מדויקות לקטעים קצרים.

  • דירוג מחדש לשאלות כפולות

    משיג תוצאות גבוהות במבחני AskUbuntu ומזהה ניסוחים שונים לאותה בעיה.

  • סיווג רגשות בטקסט קצר

    פוגע בדיוק של מעל 92 אחוז בניתוח ביקורות ומתאים לקטלוג פידבקים מהיר.

איפה זה נופל

הבעיה הבולטת ביותר היא השפה. המודל מאומן על אנגלית בלבד, כך שאם תזרקו עליו עברית תקבלו תוצאות עיוורות לחלוטין. מגבלה קריטית נוספת היא חלון ההקשר שעומד על 512 טוקנים בלבד. אי אפשר לדחוף אליו מסמכים שלמים בלי לחתוך אותם לפסקאות קצרות קודם לכן. בנוסף, בבדיקות של סיווג מורכב יותר כמו דירוג כוכבים באמזון הדיוק שלו צונח לאזור 48 אחוז, מה שמראה שבדקויות מרובות מחלקות הוא מתקשה.

שאלות
נפוצות

האם כדאי להשתמש בו לחיפוש בעברית?

לא, המודל אומן על אנגלית בלבד. אם תשתמשו בו לטקסטים בעברית איכות הווקטורים תהיה גרועה מאוד. לפרויקטים מקומיים חפשו מודל שתומך בריבוי שפות.

האם חייבים כרטיס מסך כדי להריץ אותו בפרודקשן?

ממש לא, 335 מיליון פרמטרים זה גודל שמעבד מודרני מריץ במהירות מצוינת. GPU נחוץ בעיקר אם אתם בונים אינדקס ראשוני למיליוני רשומות ורוצים לקצר זמנים.

האם הוא מסוגל לקרוא מסמכי PDF ארוכים?

לא ישירות, כי המגבלה הקשיחה שלו היא 512 טוקנים. תצטרכו לפצל כל מסמך לפסקאות קטנות, להמיר כל פסקה בנפרד, ולחפש ברמת הפסקה.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית sentence-transformers או transformers הרגילה בפייתון, ויש לו אפילו תמיכה ב־transformers.js. הקבצים שוקלים חמישה גיגה בייט בגלל דיוק float32, אבל בזמן ריצה בזיכרון המודל תופס נפח קטן בהרבה, סביב גיגה וחצי בלבד. כל מעבד מודרני ממוצע או כרטיס מסך בסיסי עם 4GB VRAM יריצו אותו בלי להזיע.

אין סיבה אמיתית לפנות לשירותי ענן חיצוניים או לשלם על API לפי קריאה במקרה הזה. הוא קל לתחזוקה מקומית, רץ מהר מאוד על חומרה זולה, ונותן לכם שליטה מלאה בפרטיות המידע.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("WhereIsAI/UAE-Large-V1")
v = m.encode(["שלום עולם"])

הרישיון

המודל משוחרר תחת רישיון MIT. זה הרישיון הכי מתירני שיש, ומותר לכם לקחת אותו, לשלב אותו במוצר מסחרי, לשנות אותו או להריץ אותו אצל לקוחות בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם. התנאי היחיד הוא שמירת הקרדיט והצהרת הרישיון המקורית בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗