GPT
N

NV-Embed-v2

קוד פתוח

nvidiacc-by-nc-4.02024-08-29

  • transformers
  • safetensors
  • nvembed
  • feature-extraction
  • mteb

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שיכוך טקסט כבד שמציע חלון הקשר ענק של 32,768 טוקנים. הוא מיועד למי שחייב לאנדקס מסמכים שלמים באנגלית בלי לקצוץ אותם לחלקים קטנים.

  • 7.9Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.6 GBמשקל הקבצים
  • 21,563הורדות בחודש

מה זה

מדובר במודל ייצוג וקטורי בעל 7.9 מיליארד פרמטרים שפותח על ידי אנבידיה, משימה שרוב התעשייה פותרת בדרך כלל עם מודלים קטנים בהרבה של כמה מאות מיליוני פרמטרים. הגודל הזה מעניק לו כושר הבחנה גבוה במיוחד במשימות סיווג ודמיון סמנטי, כפי שרואים בתוצאות מבחני MTEB עם דיוק של מעל 97 אחוזים בסיווג קוטביות וציונים גבוהים באיחזור.

הייחוד המרכזי נמצא ביכולת לעבד טקסטים ארוכים במיוחד תחת חלון של 32,768 טוקנים. במקום לחתוך מאמרים טכניים או דוחות לחתיכות קצרות של 512 טוקנים ולאבד את ההקשר הרחב, המודל הזה קורא בלוקים עצומים ומפיק מהם וקטור בודד ששומר על הקשרים מורכבים.

מתאים ל

  • אינדוקס מסמכים טכניים ארוכים

    חלון של 32K טוקנים מונע פיצול מאמרים מדעיים שפוגע במשמעות.

  • איחזור מידע למערכות RAG באנגלית

    התוצאות במבחני FEVER ו־HotpotQA מראות דיוק גבוה באיתור עובדות.

  • סיווג כוונות במערכות שיחה

    דיוק של מעל 94 אחוזים בבדיקות Massive ו־MTOP באנגלית.

איפה זה נופל

המודל מוגדר ומאומן לאנגלית בלבד, כך שהוא לא מתאים לעיבוד טקסטים בעברית או למאגרי מידע מעורבים. בנוסף, המבחנים מראים נפילות מורגשות במשימות מסוימות, למשל ביצועים חלשים יחסית בדירוג מחדש בנתוני MindSmall עם ציון של 31.75, ודיוק נמוך של 63.96 אחוזים בסיווג ביקורות אמזון מורכבות.

אותה משפחה

NV-Embed יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לאינדוקס אתר מסחרי?

לא. הרישיון הוא לא מסחרי לחלוטין. אם המערכת שלכם משרתת לקוחות משלמים או מהווה חלק מפעילות עסקית, אתם מפרים את תנאי השימוש.

האם המודל יבין עברית?

המודל הוגדר ואומן עבור השפה האנגלית בלבד. לא כדאי להסתמך עליו לטקסטים בעברית, שכן איכות הייצוג תהיה ירודה מאוד.

האם שווה לשלם על שרת חזק בשביל מודל שיכוך?

זה שווה את זה רק אם אתם חייבים להטמיע טקסטים ארוכים של אלפי מילים ביחידה אחת. למשפטים קצרים עדיף לקחת מודלים קטנים בהרבה שרצים על מעבד רגיל.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך רציני. המשקלים תופסים 14.6 גיגה בייט בפורמט float16, מה שאומר שצריך GPU עם לפחות 24 גיגה בייט זיכרון רק כדי לטעון אותו, ועוד תוספת נכבדה לזיכרון הריצה אם מנצלים את מלוא חלון ההקשר.

אם יש לכם שרת עם A10G או A100 אפשר להריץ אותו ישירות דרך ספריית transformers. למי שאין תשתית כזאת זמינה באופן רציף, כדאי לשקול פתרונות ענן או שירותי אירוח חיצוניים שמחייבים לפי קריאה, כי החזקת חומרה כזו דולקת רק בשביל אינדוקס מזדמן עולה המון כסף.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="nvidia/NV-Embed-v2")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0. זה אומר שמותר להוריד, לחקור, לשנות ולהריץ את המודל לצרכים פנימיים, מחקריים או אישיים בלבד. שימוש מסחרי מכל סוג אסור לחלוטין, כך שאי אפשר לשלב אותו במוצר שמייצר הכנסה או מוצע ללקוחות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗