GPT
S

snowflake-arctic-embed-m-long

קוד פתוח

Snowflakeapache-2.02024-04-12

  • sentence-transformers
  • onnx
  • safetensors
  • nomic_bert
  • feature-extraction

מודל שיכוך קומפקטי שמביא חלון הקשר של 8,192 טוקנים בלי לחנוק את הזיכרון. הוא מתאים למי שרוצה להטמיע מסמכים שלמים במקום לחתוך אותם לפירורים.

  • 137Mפרמטרים
  • 8,192טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 66,819הורדות בחודש

מה זה

המודל הזה יושב על ארכיטקטורת NomicBertModel עם 137 מיליון פרמטרים בלבד, שזה גודל קלאסי של מודל קל, אבל פותר את צוואר הבקבוק המוכר של מגבלת 512 הטוקנים.

במבחני MTEB הוא מפגין ביצועים מעורבים שתלויים מאוד בסוג המשימה. בסיווג טקסט רגיל הוא יציב עם דיוק סביב 78 אחוזים, ובמשימות דמיון טקסטואלי כמו BIOSSES הוא מגיע למתאם מרשים של מעל 89 אחוזים. מנגד, במבחני שליפה מורכבים כמו CQADupstack הציונים שלו נשארים בינוניים למדי, עם ממוצעי MAP שמסתובבים סביב 30 עד 40 אחוזים.

מתאים ל

  • חיפוש בקוד ובפורומים

    משיג MRR של 75.5 אחוזים בזיהוי שאלות כפולות ב־AskUbuntu ומתמודד יפה עם שאלות טכניות.

  • הטמעת מסמכים ארוכים

    קולט עד 8,192 טוקנים בבת אחת וחוסך פיצול מלאכותי של מאמרים ודוחות.

  • מיון טקסט רפואי ומדעי

    רושם מתאם גבוה של 89.1 במדדי דמיון STS לתחום הביולוגי והרפואי.

איפה זה נופל

הבעיה הבולטת ביותר שלו היא חוסר יציבות קיצוני בין משימות שונות. בסיווג של ביקורות באמזון המודל קורס לדיוק של 39.9 אחוזים בלבד, ובמשימות קלסטור של פטנטים הוא מציג ציון V-measure נמוך של כמעט 21 אחוזים. בנוסף, הכרטיס מפרט תוצאות באנגלית בלבד, ואין שום נתון על ביצועים בעברית, כך שסביר להניח שהוא יגמגם מאוד בשפה המקומית.

שאלות
נפוצות

האם המודל מתאים לטקסטים בעברית?

אין בכרטיס המודל שום אזכור לאימון או בדיקה בעברית, והציונים המדווחים הם על דאטה־סטים באנגלית בלבד. אם המוצר שלכם כולל עברית, אל תבנו עליו בלי לעשות בדיקת איכות מקדימה, כי רוב הסיכויים שתקבלו תוצאות מאכזבות.

כמה זיכרון GPU דרוש כדי לרוץ איתו על חלון מלא?

המודל עצמו תופס כ־2 גיגה בייט בזיכרון, אך כאשר דוחפים אליו טקסטים ארוכים עד קצה חלון ההקשר של 8,192 טוקנים, פעולת ה־Attention תדרוש זיכרון נוסף. מומלץ להחזיק כרטיס מסך עם לפחות 8 גיגה זיכרון כדי לעבוד בצורה יציבה עם מסמכים ארוכים בקבוצות.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers הרגילה בפייתון, כשהמשקל הכולל של הקבצים עומד על 2.0 גיגה בייט בפורמט float32. כל מעבד מודרני ממוצע יכול להריץ אותו בלי בעיה, ואפילו כרטיס מסך בסיסי עם 4 או 6 גיגה זיכרון יספיק פה מעל ומעבר כדי לעבד מסמכים מלאים במקביל.

יש גם תמיכה ב־transformers.js, מה שאומר שאפשר עקרונית לטעון אותו ישירות בדפדפן או בסביבת Node.js. שווה להחזיק אותו על שרת פרטי רק אם חייבים פרטיות מידע קפדנית, כי במחירים של מודלי שיכוך בענן, עלות התחזוקה העצמית של שרת ייעודי תהיה לרוב גבוהה יותר משימוש בשירות מנוהל.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Snowflake/snowflake-arctic-embed-m-long")
v = m.encode(["שלום עולם"])

הרישיון

רישיון apache-2.0 הוא רישיון קוד פתוח מתירני מאוד. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להריץ אותו במוצר פנימי או לחלק אותו מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗