GPT
S

stella_en_400M_v5

קוד פתוח

NovaSearchmit2024-07-12

  • sentence-transformers
  • pytorch
  • safetensors
  • new
  • feature-extraction

מודל שיכוך טקסט קומפקטי שתומך במסמכים ארוכים של עד 8,192 טוקנים. הוא נותן מענה חזק לשליפת מידע ודירוג מחדש באנגלית בלי להעמיס על השרת.

  • 435Mפרמטרים
  • 8,192טוקנים בהקשר
  • 3.5 GBמשקל הקבצים
  • 78,037הורדות בחודש

מה זה

מדובר במודל דחיסת משפטים וייצוג וקטורי מבית NovaSearch, עם 435 מיליון פרמטרים וחלון הקשר של 8,192 טוקנים. הוא רץ על ארכיטקטורת 24 שכבות ומיועד למשימות דמיון סמנטי, סיווג ושליפה של מסמכים מלאים, תחום שבו רוב המתחרים בגודל הזה מוגבלים ל־512 טוקנים בלבד.

במבחני MTEB הרשמיים הוא מציג תוצאות מעורבות. בסיווג רגש הוא פוגע יפה מאוד עם דיוק של 97.19% על AmazonPolarity ו־92.35% על AmazonCounterfactual, אבל כשזה מגיע לניתוח ביקורות מורכב יותר הוא צונח ל־59.52%. במשימות אחזור כמו ArguAna הוא מביא ציון NDCG@10 של 64.24, מה שאומר שהוא מסתדר טוב עם התאמת טיעונים וחיפוש שאינו מבוסס רק על מילות מפתח זהות.

מתאים ל

  • חיפוש מסמכים ארוכים

    חלון של 8,192 טוקנים מאפשר להמיר מאמרים ודוחות מלאים באנגלית לווקטור בלי לחתוך אותם לפסקאות קטנות.

  • סינון וסיווג שאלות

    התוצאות במבחן AskUbuntu מראות יכולת טובה בזיהוי שאלות כפולות ומציאת תוכן טכני דומה.

  • קיבוץ מאמרים מדעיים

    המודל נבדק על מאגרי Arxiv ומגיע לביצועים סבירים בחיבור בין טקסטים מחקריים בעלי נושא משותף.

איפה זה נופל

השם stella_en מסגיר מיד את הבעיה העיקרית: הוא אומן על אנגלית. אין כאן תמיכה רשמית בעברית, ואם תנסו להזין לו טקסט ישראלי מקומי התוצאות יהיו בלתי שמישות. בנוסף, במשימות אחזור מסוימות כמו ClimateFEVER הדיוק הראשוני נמוך למדי עם ציון MAP@1 של 19.29% בלבד, מה שמחייב בדיקה של התוצאות מול הנתונים שלכם לפני שסומכים עליו.

אותה משפחה

stella-en יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש בו לאפליקציה שמטפלת בעברית?

לא. המודל מיועד מראש לאנגלית בלבד, וכל המבחנים שלו בכרטיס מתייחסים לשפה זו. אם המערכת שלכם צריכה לזהות מסמכים או שאלות בעברית, תצטרכו לחפש מודל רב־לשוני.

כמה זיכרון GPU דרוש כדי לעבד טקסטים ארוכים באמת?

המודל שוקל 3.5 גיגה־בייט בזיכרון, אבל חלון של 8,192 טוקנים דורש מקום נוסף לשכבות הקשב בזמן הריצה. מומלץ לעבוד עם כרטיס של 8 גיגה לפחות כדי לא לקבל שגיאות חוסר זיכרון במסמכים מלאים.

איך מריצים

המודל שוקל 3.5 גיגה־בייט ונשמר בדיוק של float32, כך שתוכלו לטעון אותו ישירות דרך ספריית sentence-transformers. להרצה מקומית או בשרת ייעודי מספיק כרטיס מסך פשוט יחסית עם 6 עד 8 גיגה זיכרון כדי לעבד קלטים ארוכים בלי חנק.

אם אתם צריכים רק וקטורים לכמה מאות פסקאות ביום, כנראה שפשוט יותר לקרוא ל־API חיצוני. לעומת זאת, אם יש לכם נפח עבודה רציף של אינדוקס מסמכים באנגלית ואתם רוצים עצמאות מלאה בלי לשלם על כל קריאה, הגודל הזה יושב בול על שרת זול בודד.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("NovaSearch/stella_en_400M_v5")
v = m.encode(["שלום עולם"])

הרישיון

המודל שוחרר ברישיון MIT. המשמעות פשוטה, מותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים וסגורים, לשנות את המשקלים ולהריץ אותו איפה שרוצים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗