GPT
E

embeddinggemma-300m-GGUF

קוד פתוח

unslothgemma2025-09-04

  • sentence-transformers
  • gguf
  • sentence-similarity
  • feature-extraction
  • text-embeddings-inference

המרת טקסט למספרים בשביל חיפוש מקומי על לפטופ או טלפון. הוא מביא ביצועים טובים ממשקל זעום בלי שתצטרכו לשלם לפי קריאה.

  • 2.3 GBמשקל הקבצים
  • 15,442הורדות בחודש
  • 87לייקים

מה זה

גוגל בנו כאן מודל וקטורי של 300 מיליון פרמטרים שמבוסס על סדרת ג׳מה 3, והוא מתחרה ישירות בכל המודלים הקטנים שמיועדים להרצה מקומית. היתרון הבולט הוא טכניקת מטריושקה, שמאפשרת לכם לחתוך את הווקטור מ־768 ממדים ל־512, 256 או אפילו 128 בלי לאבד הרבה מהדיוק. בבנצ׳מרק MTEB באנגלית, חיתוך מ־768 ל־128 מוריד את הציון מ־68.36 ל־65.09 בלבד. זה אומר חיסכון דרסטי במקום בבסיס הנתונים הווקטורי שלכם בלי לשלם מחיר כבד באיכות התוצאות.

הוא אומן על מעל 320 מיליארד טוקנים בלמעלה ממאה שפות, כולל קוד ומסמכים טכניים. בנוסף, הוא נשען על תבניות פניות מובנות לפי משימה. אם אתם מחפשים קוד, מסווגים טקסט או בונים חיפוש רגיל, המודל משתמש בקידומת ייעודית שמשנה את צורת הווקטור כדי לדייק את ההתאמה.

מתאים ל

  • חיפוש מקומי באפליקציות

    הוא שוקל מעט ועובד על חומרת קצה בלי לשלוח שום מידע לענן חיצוני.

  • איתור קטעי קוד

    הוא כולל תמיכה מובנית בחיפוש קוד ומחזיר תוצאות סבירות לשאילתות טכניות.

  • אינדוקס חסכוני בזיכרון

    חיתוך הווקטור ל־128 ממדים מאפשר לשמור המון וקטורים ברם בלי לחנוק את השרת.

איפה זה נופל

הקשר הקלט מוגבל ל־2048 טוקנים. זה מספיק לפסקאות ומסמכים קצרים, אבל לא מתאים לטחינה של קבצי PDF ארוכים במכה בלי לחתוך אותם לחתיכות קטנות קודם. התיעוד מודה בפירוש בקושי עם ניואנסים, סרקזם ושפה ציורית.

למרות שהאימון כלל מעל מאה שפות, אין בכרטיס פירוט ספציפי על איכות העברית. בבדיקות רב-לשוניות כלליות הציון יורד לאזור ה־61 לעומת 68 באנגלית, כך שחובה לבדוק אותו על הדאטה הספציפי שלכם לפני שסומכים עליו בעברית.

שאלות
נפוצות

האם אפשר להשתמש בו בזיכרון מוגבל של שרת קטן?

כן. בגלל שמדובר ב־300 מיליון פרמטרים בלבד, צריכת הזיכרון שלו נמוכה מאוד ומתאימה לשרתים פשוטים. אם תבחרו להשתמש בווקטורים קטנים של 256 או 128 ממדים, תחסכו גם המון מקום במסד הנתונים הווקטורי.

האם המודל תומך בעברית בצורה טובה?

הוא אומן על יותר ממאה שפות, אך המדדים הרב-לשוניים שלו מציגים ציונים נמוכים יותר מאשר באנגלית. אין נתון נפרד לעברית בכרטיס, ולכן כדאי להריץ עליו מבחן קצר עם טקסטים שלכם לפני שמחליטים.

איך מריצים

המודל הזה קל מאוד. כל הקבצים שלו ביחד תופסים 2.3 גיגה בייט, ובפורמט GGUF מכווץ כמו Q4_0 או Q8_0 אפשר להריץ אותו בלי שום בעיה על מעבד של מחשב נייד רגיל או טלפון. בבדיקות כיווץ, גרסת Q4_0 כמעט לא שוחקת את הדיון לעומת המקור, עם 67.91 מול 68.36 באנגלית.

הוא רץ דרך ספריית sentence-transformers, אבל שימו לב שהאקטיבציות שלו לא תומכות ב־float16 אלא דורשות bfloat16 או float32. אם אתם צריכים לאנדקס מיליוני מסמכים בשעה ואין לכם שרת ייעודי, עדיף להשתמש ב־API מנוהל. אם אתם רוצים פרטיות מוחלטת או אפליקציה שעובדת אופליין על המכשיר, זה הגודל הנכון.

ollama run hf.co/unsloth/embeddinggemma-300m-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 2.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון ג׳מה הרשמי של גוגל. הוא מאפשר שימוש מסחרי, אבל כפוף למדיניות השימושים האסורים של גוגל. אתם יכולים להטמיע אותו במוצר חופשי כל עוד אתם לא מפרים את תנאי הבטיחות שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗