GPT
N

nomic-embed-text-v1.5

קוד פתוח

nomic-aiapache-2.02024-02-10

  • sentence-transformers
  • onnx
  • safetensors
  • nomic_bert
  • feature-extraction

מודל שיבוץ טקסט שמציע חלון הקשר של 2,048 טוקנים בגודל של 137 מיליון פרמטרים בלבד. הוא מתאים למי שצריך לאחזר פסקאות ארוכות בלי לשלם על מודל ענק.

  • 137Mפרמטרים
  • 2,048טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 16,210,409הורדות בחודש

מה זה

המודל מבוסס על ארכיטקטורת NomicBertModel עם 12 שכבות, ונועד להפקת וקטורים עבור חיפוש סמנטי, סיווג ודירוג מחדש. רוב המודלים בקטגוריית הגודל הזו מוגבלים בדרך כלל לטווח קצר בהרבה, ולכן חלון של 2,048 טוקנים נותן כאן יתרון מעשי בעיבוד מסמכים שלמים בלי צורך לחתוך אותם לחתיכות זעירות.

במבחני MTEB הרשמיים שנמדדו בכרטיס, הוא מציג תוצאות מעורבות שתלויות בסוג המשימה. בסיווג קוטביות של אמזון הוא הגיע לדיוק של 91.81%, ובמשימות דמיון סמנטי ביולוגי הגיע למתאם פירסון של 86.73. מנגד, באחזור טקסטים טכניים מורכבים כמו פורומים של מתמטיקה הוא משיג דיוק נמוך משמעותית, עם precision של 5.36% בלבד בעשירייה הראשונה.

מתאים ל

  • חיפוש סמנטי באנגלית

    מתאים לאחזור מאמרים ארוכים באנגלית בזכות חלון של 2,048 טוקנים.

  • זיהוי כפילויות טכניות

    קיבל ציון MRR של 76.06 במבחני דירוג שאלות כפולות ב־AskUbuntu.

  • סיווג תלונות וטקסטים

    מציג דיוק של 84.25% במאגר הבנקאות Banking77 מתוך הכרטיס.

איפה זה נופל

החולשה העיקרית שלו מגיעה בשפות. המודל מאומן על אנגלית בלבד, כך שלא הייתי משתמש בו לשום פרויקט שכולל עברית. הוא פשוט יפספס לחלוטין את ההקשר. בנוסף, באחזור שאלות ותשובות מקצועיות הוא מתקשה להחזיר תוצאות מדויקות כבר במקומות הראשונים, כפי שנראה במדדי map_at_1 הנמוכים בבדיקות של CQADupstack.

אותה משפחה

nomic-embed-text יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד על טקסטים בעברית?

לא. המודל מוגדר ומאומן עבור אנגלית בלבד. אם תזינו לו עברית תקבלו שיבוצים באיכות נמוכה שלא יתאימו לחיפוש אמיתי.

כמה זיכרון וידאו צריך בפועל בשביל להריץ אותו?

המשקל של הקבצים הוא 2.1 גיגה בייט ב־float32. כרטיס מסך פשוט עם 4 גיגה זיכרון יספיק לעבודה שוטפת, ואפשר להריץ אותו ישירות גם על גבי מעבד רגיל.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בפייתון או בפורמט transformers.js. המשקל הכולל של הקבצים עומד על 2.1 גיגה בייט בדיוק float32, מה שאומר שהוא רץ בלי מאמץ על כרטיס מסך בסיסי עם 4 גיגה זיכרון, ואפשר להריץ אותו בקלות גם על מעבד רגיל בשרת פשוט.

אם אתם צריכים לאנדקס כמויות קטנות או לבנות חיפוש פנימי בתוך הרשת המקומית, שווה להריץ אותו לבד ולחסוך תלויות חיצוניות. כשיש מיליוני מסמכים לאינדוקס מהיר או שאין לכם שרת ייעודי שמחזיק תהליך פעיל בזיכרון, פנייה לפתרון מנוהל תהיה פשוטה יותר לתחזוקה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("nomic-ai/nomic-embed-text-v1.5")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית כחלק ממוצר שלכם. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗