GPT
G

gte-modernbert-base

קוד פתוח

Alibaba-NLPapache-2.02025-01-20

  • transformers
  • pytorch
  • onnx
  • safetensors
  • modernbert

מודל שיכוך טקסט קומפקטי באנגלית שמיועד לשליפת מסמכים ארוכים וקוד, עם חלון של 8,192 טוקנים שמייתר פיצול אגרסיבי של טקסטים.

  • 149Mפרמטרים
  • 8,192טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 177,335הורדות בחודש

מה זה

מדובר במודל אנקודר בלבד שמייצר וקטורים באורך 768 ממדים, ומבוסס על הארכיטקטורה החדשה של ModernBert במקום הבסיס הוותיק של סדרת GTE. המשמעות המעשית היא ארכיטקטורה עדכנית יותר וקלה שמפיקה ייצוג סמנטי איכותי בלי לדרוש מפלצת של מיליארדי פרמטרים.

במדדי השוואה מול מודלים קטנים ממיליארד פרמטרים, הוא עוקף את המתחרים הישירים בגודל שלו. במבחן MTEB הכללי הוא רושם ציון ממוצע של 64.38, כשבמשימות שליפה (Retrieval) הוא מגיע ל־55.33 ועוקף מודלים כבדים בהרבה כמו bge-large-en-v1.5 ו־multilingual-e5-large-instruct. החוזק האמיתי שלו נמדד בטקסטים ארוכים, שם במבחן LoCo הוא משיג 88.88 בממוצע, וכן בחיפוש קוד במבחן CoIR עם ממוצע של 79.31.

מתאים ל

  • מנועי RAG למסמכים ארוכים

    חלון של 8,192 טוקנים מאפשר לקרוא דוחות שלמים, חוזים וקבצים טכניים בלי לחתוך פסקאות באמצע.

  • חיפוש סמנטי במאגרי קוד

    תוצאות גבוהות במבחני COIR מעידות על התאמה לשליפת פונקציות וקטעי קוד בשפות פיתוח נפוצות.

  • שליפה ישירה בצד לקוח

    התמיכה ב־transformers.js ומשקל נמוך מאפשרים להפיק וקטורים ישירות בדפדפן ללא פנייה לשרת.

איפה זה נופל

הוא מיועד לאנגלית בלבד. אם יש לכם צורך בעברית או טקסט רב־לשוני, הוא לא הבחירה הנכונה, שכן עליבאבא ייעדו אותו לשפה אחת ולא שילבו בו נתונים רב־לשוניים כמו בגרסאות ה־multilingual שלהם.

נקודת תורפה נוספת שעולה מלוח התוצאות היא משימות סיכום, שם קיבל ציון נמוך של 30.68 במבחן MTEB, ותחומים מסוימים בתוך עולם הקוד שבהם הביצועים צונחים, כמו תחרותיות ותכנות דינמי (codetrans-dl קיבל 35.46 בלבד). בנוסף, במשימות תיוג וסיווג טהורות מודלים גדולים יותר עדיין מובילים עליו.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

הכרטיס מגדיר את האנגלית כשפה הראשית של המודל. הוא לא אומן עבור עברית, ולכן עבור מסמכים בשפה זו עדיף לבחור מודל ייעודי רב־לשוני.

מה ההבדל בינו לבין מודל הריראנקר מאותה סדרה?

מודל זה מייצר וקטורים לשליפה מהירה מתוך מאגר גדול באמצעות דמיון קוסינוס. גרסת ה־reranker בודקת צמדים של שאילתה ומסמך כדי לדרג מחדש מספר קטן של תוצאות שכבר נשלפו.

איך מריצים

המודל שוקל 2.4 ג'יגה־בייט בלבד ורץ בקלות בספריות transformers הרגילה או sentence-transformers, עם תמיכה ישירה ב־Flash Attention 2 למי שיש לו GPU תואם ורוצה לחסוך זיכרון. מי שמעדיף תשתית שרתית קלאסית יכול להרים אותו ישירות בתוך קונטיינר של Text Embeddings Inference מבית Hugging Face על מעבד רגיל או מאיץ גרפי, ולקבל ממשק תואם OpenAI בנתיב v1/embeddings. יש גם תמיכה ישירה בדפדפן או ב־Node דרך transformers.js.

בגלל המשקל הנמוך, כל כרטיס מסך בסיסי או שרת ענן פשוט יריצו אותו בלי בעיה. שווה להחזיק אותו עצמאית אם אתם מעבדים מסמכים רגישים שלא רוצים להוציא החוצה או רוצים להימנע מתשלום לפי טוקנים. אם אין לכם שרת ייעודי שפועל ממילא והיקף השליפות שלכם נמוך ומזדמן, תחזוקת שרת בשבילו עשויה להיות מיותרת.

from transformers import pipeline

pipe = pipeline("sentence-similarity", model="Alibaba-NLP/gte-modernbert-base")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לארח אותו במוצר פנימי או מסחרי ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗