GPT
M

modernbert-embed-base

קוד פתוח

nomic-aiapache-2.02024-12-29

  • sentence-transformers
  • onnx
  • safetensors
  • modernbert
  • feature-extraction

מודל שיבוץ קומפקטי של 149 מיליון פרמטרים שמציע חלון הקשר עצום של 8,192 טוקנים. הוא פותר את בעיית הדחיסה של מסמכים ארוכים בלי לדרוש שרתים כבדים.

  • 149Mפרמטרים
  • 8,192טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 230,663הורדות בחודש

מה זה

המודל הזה מבוסס על ארכיטקטורת ModernBertModel ומיועד למשימות דמיון בין טקסטים ואחזור מידע. בעוד שרוב מודלי ה־BERT הקלאסיים נחנקים אחרי 512 טוקנים, כאן הגבול נמתח ל־8,192 טוקנים בתוך 22 שכבות ומשקל צנוע יחסית. זה אומר שאפשר לבלוע מאמרים שלמים, תלונות לקוחות ארוכות או מסמכים טכניים בלי לחתוך אותם למקטעים קטנים שמאבדים הקשר.

מבחינת ביצועים במבחני MTEB, הוא מציג תמונה מעורבת שחשוב להבין. בסיווג פולאריות של ביקורות הוא פוגע מצוין עם דיוק של 93.09%, אבל בסיווג מורכב יותר של ביקורות רגילות הוא צונח ל־48.42%. באחזור מידע במבחן ArguAna הוא מגיע ל־Recall של 78.52% בעשירייה הראשונה, כך שכדי לקבל תוצאות טובות באמת צריך לאחזר כמות נדיבה של מועמדים.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    חלון של 8,192 טוקנים מאפשר להמיר מסמכים שלמים לווקטור אחד בלי לאבד את ההקשר הכללי.

  • ניתוח סנטימנט באנגלית

    הדיוק שלו בסיווג קוטביות עומד על 93.09%, מה שמספיק בהחלט למיון פידבקים וביקורות.

  • הרצה מקומית על מחשבי קצה

    הוא תומך ב־transformers.js ושוקל מעט, כך שאפשר להריץ אותו ישירות בדפדפן בלי שרת.

איפה זה נופל

הבעיה המרכזית שלו היא שפות. המודל אומן ותועד אך ורק באנגלית, כך שאם הדאטה שלכם מכיל עברית, הוא כנראה ייצר וקטורים חסרי משמעות וייכשל באחזור. מעבר לזה, תוצאות המדידה שלו בסיווג רב מחלקתי חלשות מאוד, והוא מתקשה לדייק כשיש יותר מדי אפשרויות דומות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לחיפוש טקסטים בעברית?

לא. הכרטיס מציין תמיכה באנגלית בלבד. אם תריצו עליו עברית תקבלו תוצאות גרועות מאוד ולא אמינות.

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו ביציבות?

המשקל של הקבצים הוא 2.4 גיגה בייט. כרטיס מסך עם 6 גיגה זיכרון יספיק לעיבוד מסמכים ארוכים בלי נפילות זיכרון.

איך מריצים

בזכות משקל קבצים של 2.4 גיגה בייט בפורמט float32, אפשר להריץ אותו ישירות דרך ספריית sentence-transformers או אפילו בדפדפן ובסביבות קצה עם transformers.js. כל כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון יחזיק אותו בקלות, וגם על גבי מעבד סביר הוא יספק זמני תגובה טובים אם כמות הבקשות מתונה.

מתי עדיף שירות ענן חיצוני. רק אם אתם בונים מערכת שצריכה לעבד אלפי מסמכים ארוכים במקביל בכל דקה, ואין לכם עניין לנהל שרתים וסקלביליות בעצמכם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("nomic-ai/modernbert-embed-base")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ ברישיון apache-2.0 חופשי לחלוטין. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, להריץ אותו בשרתים פרטיים ולמכור שירותים שמבוססים עליו, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗