GPT
E

embeddinggemma-300m-ONNX

קוד פתוח

onnx-communitygemma2025-08-22

  • transformers.js
  • onnx
  • gemma3_text
  • feature-extraction
  • text-embeddings-inference

גרסת ONNX של מודל האמבדינג מבית גוגל מאפשרת לחלץ וקטורים ישירות בתוך דפדפנים או בשרתים מקומיים. היא מתאימה למי שחייב עבודה בלי תלות ברשת ורוצה תמיכה גמישה באורכי וקטור שונים.

  • 2,048טוקנים בהקשר
  • 2.6 GBמשקל הקבצים
  • 166,046הורדות בחודש
  • 73לייקים

מה זה

גוגל בנו את המודל על בסיס ארכיטקטורת גמה שלוש עם 24 שכבות, והוא אומן על 320 מיליארד טוקנים ביותר ממאה שפות כולל קוד ומסמכים טכניים. המרה לפורמט ONNX מנגישה אותו ישירות דרך ספריית transformers.js בסביבות JavaScript או בתוך מנועי הסקה כמו TEI, בלי צורך בסביבת פייתון כבדה. המודל מייצר וקטורים באורך בסיס של 768, אך תומך בקיצוץ מובנה למידות של 512, 256 או 128 באמצעות Matryoshka Representation Learning, מה שחוסך מקום במסד הנתונים הווקטורי במחיר פגיעה מזערית בדיוק.

במדדי MTEB המודל מציג פערים ברורים בין סוגי התוכן. במשימות קוד הוא מגיע לציון של 68.76, ובאנגלית לציון 68.36, לעומת ציון נמוך משמעותית של 61.15 במשימות רב לשוניות. המשמעות היא שטקסטים באנגלית ובקוד מקבלים ייצוג מדויק בהרבה מאשר שפות אחרות, וקיצוץ הוקטור למידה של 128 מוריד את הציון בקוד עד ל־62.96. גם גרסאות הקוונטיזציה שנבדקו מראות ירידה מתונה בלבד בדיוק, עם ציון של 67.91 באנגלית בפורמט Q4 לעומת הוקטור המלא.

מתאים ל

  • חיפוש בקוד מקור

    אינדוקס מאגרי קוד וחיפוש קטעי תוכנה ישירות מתוך שאילתות בשפה טבעית.

  • חיפוש סמנטי מקומי בדפדפן

    חילוץ וקטורים ישירות אצל משתמש הקצה באמצעות JavaScript ללא שרת חיצוני.

  • סיווג וסינון פניות

    חלוקת מסמכים ופניות קצרות לקטגוריות על בסיס וקטורים מקוצצים שחוסכים מקום.

איפה זה נופל

חלון ההקשר מוגבל ל־2,048 טוקנים בלבד, כך שהוא לא מסוגל לקרוא מסמכים ארוכים או קובצי קוד שמנים בלי חיתוך אגרסיבי מראש. הכרטיס מודה בקושי מול ניואנסים עדינים, ביטויים ציוריים וסרקזם. בנוסף, חובה להוסיף תחיליות ייעודיות כמו משימת חיפוש או סיווג לפני כל טקסט כדי לקבל תוצאות אופטימליות, מה שמסבך את הפיתוח. בעברית הביצועים יהיו נמוכים משמעותית מאשר באנגלית, כפי שמעידים ציוני הבנצ'מרק הרב לשוניים.

שאלות
נפוצות

האם המודל מתאים לטקסטים בעברית?

המודל אומן על מעל מאה שפות אך הציונים שלו במבחנים רב לשוניים נמוכים משמעותית מהציונים באנגלית. טקסטים בעברית יעבדו, אבל איכות הדיוק וההבנה של מונחים מורכבים תהיה פחות טובה, ולכן חובה לבדוק אותו מול הנתונים שלכם לפני שילוב במערכת פעילה.

האם חייבים להשתמש בוקטור באורך 768 המלא?

לא. בזכות אימון בשיטת MRL אפשר לחתוך את הוקטור לאורכים של 512, 256 או 128 טוקנים ולבצע נרמול מחדש. הקיצוץ מקטין את נפח האחסון בצורה דרסטית במסד הנתונים ומשלם רק בירידה קלה ברמת הדיוק.

איך מריצים

משקל הקבצים עומד על 2.6 ג'יגה בייט ודורש מעבד מודרני רגיל או כרטיס גרפי פשוט. הכרטיס מציין במפורש שהאקטיבציות במודל לא תומכות בפורמט fp16, ולכן חייבים לעבוד בפורמט float32 מלא או לרדת לגרסאות מקוונטטות כמו q8 ו־q4 כדי לחסוך זיכרון. אפשר להרים אותו בקלות דרך מכולת Docker של Text Embeddings Inference באמצעות חיבור פשוט למעבד.

אם אתם מחפשים הרצה מהירה של מסמכים ארוכים באמת בארגון גדול, תשלום ל־API של שירות מנוהל יחסוך את כאב הראש של ניהול זיכרון ותשתיות, במיוחד בהתחשב במגבלת ההקשר הקצרה יחסית של המודל.

pip install -U huggingface_hub
hf download onnx-community/embeddinggemma-300m-ONNX

הרישיון

הרישיון הוא רישיון gemma של גוגל. הוא מאפשר שימוש מסחרי והפצה בתוך מוצרים, אבל מחייב עמידה במדיניות השימושים האסורים של גוגל וכולל תנאי שימוש ספציפיים למשפחת המודלים הזו ולא רישיון קוד פתוח סטנדרטי מסוג אפאצ'י או MIT.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗