GPT
E

embeddinggemma-300M-GGUF

קוד פתוח

ggml-orgרישיון לא דווח2025-09-04

  • gguf
  • endpoints_compatible

מודל שיבוץ קטן במיוחד שרץ מקומית בלי לגעת בכרטיס מסך יקר. הוא מתאים למי שצריך לחלץ וקטורים מטקסט במהירות ובתוך תשתית קיימת של llama.cpp.

  • 318 MBמשקל הקבצים
  • 300,533הורדות בחודש
  • 45לייקים

מה זה

מדובר במודל וקטורי שנועד לייצר ייצוגים מספריים לטקסט, ארוז בפורמט שמתאים ישירות לכלים של llama.cpp. עם משקל כולל של 318 מגה בייט על פני שלושה קבצים, הוא פונה ישירות למי שמחפש פתרון קל משקל שלא דורש משאבים כבדים או שרת ייעודי גדול.

הכרטיס מציג שליטה מובנית בנרמול הווקטורים דרך פרמטר ייעודי, כשהברירת מחדל היא נרמול אוקלידי. אפשר להגדיר גם ללא נרמול בכלל או נרמולים אחרים כמו מרחק מנהטן, מה שנותן גמישות טכנית כשמחברים אותו למסדי נתונים וקטוריים שדורשים סוגי חישוב שונים כמו דמיון קוסינוס.

מתאים ל

  • חיפוש מקומי באפליקציה

    הוא שוקל 318 מגה בייט ורץ מקומית דרך llama.cpp, מה שמאפשר חיפוש וקטורי במכשיר עצמו ללא תלות ברשת.

  • אחזור מידע למערכות RAG

    הוא מספק וקטורים מנורמלים בברירת מחדל, שמתאימים מיד לחישובי דמיון מול מסדי נתונים וקטוריים.

  • עיבוד טקסטים בתקציב נמוך

    הגודל הקומפקטי שלו מאפשר להרים שירות שיבוץ על שרתים פשוטים וזולים בלי להחזיק כרטיסי מסך יקרים.

איפה זה נופל

דף המודל לא מציג מבחני ביצועים, ציוני דיוק או נתונים על שפות נתמכות. אי אפשר לדעת מהכרטיס איך הוא מתמודד עם טקסט שאינו אנגלית, ובמיוחד עם עברית, כך שתצטרכו לבדוק בעצמכם את איכות האחזור לפני שתסמכו עליו בייצור. בנוסף, מודל של 300 מיליון פרמטרים מוגבל מראש בעומק הסמנטי שלו בהשוואה למודלים גדולים יותר.

שאלות
נפוצות

איך מחברים את המודל לקוד קיים?

מריצים את פקודת llama-server עם הדגל של embeddings, ואז שולחים בקשות POST סטנדרטיות בפורמט JSON לכתובת המקומית. אפשר להעביר בגוף הבקשה גם את שיטת הנרמול הרצויה לווקטורים.

האם הוא מתאים לטקסטים בעברית?

אין בתיעוד שום מידע על שפות נתמכות או איכות התוצאות בעברית. לפני שאתם בונים עליו, חובה להריץ בדיקה קטנה עם טקסטים מקומיים ולראות אם הווקטורים בכלל שומרים על משמעות סמנטית.

איך מריצים

אתם מריצים אותו ישירות דרך llama-server עם דגל embeddings כדי לקבל שרת מקומי שמאזין לבקשות בפורט 8080, או פונים אליו ישירות משורת הפקודה באמצעות llama-embedding. המודל שוקל 318 מגה בייט בלבד, כך שכל מעבד פשוט של מחשב נייד או שרת ענן בסיסי מריץ אותו בלי להרגיש ובלי צורך בכרטיס מסך ייעודי.

אם יש לכם עומסים נמוכים עד בינוניים או דרישה שהמידע לא ייצא מהרשת הפנימית, הרצה עצמית כאן היא עניין של שניות ולא מצדיקה תשלום על תעבורה חיצונית. לעומת זאת, אם אתם צריכים לאנדקס מיליוני מסמכים בשעה ואין לכם עניין לנהל שרתים ותהליכי רקע, שירות ענן מנוהל יחסוך את כאב הראש התפעולי.

ollama run hf.co/ggml-org/embeddinggemma-300M-GGUF:Q8_0

הקבצים

3 קבצים במאגר, 318 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא פרסמו רישיון עבור הקבצים האלה. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו, להפיץ אותו או לשלב אותו במוצר מסחרי. מי שבונה מערכת מסחרית לוקח פה סיכון עד שהמפרסמים יבהירו את הסטטוס המשפטי.

הרישיון המלא בעמוד המודל ↗