GPT
Q

Qwen3-Embedding-4B-GGUF

קוד פתוח

Qwenapache-2.02025-06-05

  • transformers
  • gguf
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF למודל וקטורי בינוני שדוחסת ביצועים של מודלים גדולים לתוך שרת מקומי. הפתרון מיועד למי שצריך חלון הקשר של 32k וגמישות בממדי הווקטור בלי לשלוח מידע החוצה.

  • 22.2 GBמשקל הקבצים
  • 41,624הורדות בחודש
  • 124לייקים

מה זה

מדובר במודל וקטורי של 4 מיליארד פרמטרים מבית Qwen, שמגיע בפורמט GGUF להרצה דרך ספריות כמו llama.cpp. הוא מיועד למשימות חיפוש טקסט, קיבוץ, סיווג, ואחזור קוד בלמעלה ממאה שפות. המאפיין הבולט כאן הוא תמיכה ב־MRL, שמאפשרת לכם לקבוע את ממד הווקטור בין 32 ל־2560 לפי מגבלות הזיכרון ומסד הנתונים שלכם, לצד חלון הקשר של 32 אלף תווים.

במבחני MTEB רב־לשוניים גרסת ה־4B מקבלת ציון ממוצע משימות של 69.45, שגובר בפער ברור על מודלים סגורים כמו gemini-exp עם 68.37 ו־text-embedding-3-large עם 58.93. במבחני אחזור הוראות באנגלית הוא מגיע לציון 11.56, גבוה אפילו מגרסת ה־8B באותו מבחן. המספרים האלה מראים שהוא מחלץ משמעות מעולה מטקסטים ארוכים ומורכבים, בלי לדרוש שרת ייעודי עצום.

מתאים ל

  • מנועי חיפוש פנימיים ו־RAG

    חלון של 32k מאפשר לאנדקס מסמכים משפטיים או טכניים שלמים ללא פיצול אגרסיבי.

  • אחזור קוד במאגרי פיתוח

    האימון כלל שפות תכנות ונותן דיוק גבוה בחיפוש קטעי קוד מתוך פניות בשפה חופשית.

  • אחסון וקטורי מוגבל במקום

    התמיכה ב־MRL מאפשרת לכווץ את הווקטור עד לגודל 32 ולחסוך זיכרון בבסיס הנתונים.

איפה זה נופל

המודל תלוי בהוראות מקדימות. היוצרים מציינים שבלי הגדרת instruct מדויקת באנגלית לפני השאילתה, יש ירידה של 1 עד 5 אחוזים ברמת הדיוק באחזור. אם הטקסטים שלכם בעברית וההוראה לא תנוסח באנגלית מותאמת למשימה, תאבדו איכות. חסרון נוסף מופיע בסיכום טקסטים, שם הוא קיבל במבחן האנגלי ציון של 34.39 לעומת 38.28 של ג'מיני, כך שהוא פחות מבריק בהכללה של מסמכים שלמים.

אותה משפחה

Qwen3-Embedding יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חייבים לכתוב את ההוראות למודל באנגלית גם כשהטקסט בעברית?

כן, המפתחים ממליצים בפירוש לנסח את ה־instruct באנגלית כי רוב האימון נעשה כך. טקסט השאילתה עצמו יכול להיות בעברית, אבל הגדרת המשימה צריכה להישאר באנגלית כדי לא לפגוע בדיוק.

מה היתרון של גרסת ה־4B על פני גרסת ה־0.6B הקטנה?

גרסת ה־4B מציגה קפיצה ניכרת במשימות מורכבות כמו אחזור לפי הוראות, עם ציון של 11.56 לעומת 5.09 בלבד בגרסה הקטנה. אם החומרה שלכם מאפשרת להחזיק כ־4 גיגה בייט בזיכרון, תוספת האיכות מורגשת מאוד.

איך קובעים את גודל הווקטור שהמודל מוציא?

המודל תומך ב־MRL מובנה, מה שאומר שאתם פשוט חותכים את הווקטור שמתקבל באורך הרצוי בין 32 ל־2560. המודל אומן לשמור על המידע החשוב ביותר ברכיבים הראשונים, כך שהדיוק נשמר גם בממדים קטנים.

איך מריצים

את המודל מריצים ישירות עם llama.cpp, כשרת מקומי או כפקודה שמחלצת וקטורים עם llama-embedding ודגל pooling last. במאגר זמינות שש גרסאות כימות שונות, מ־q4_K_M הקלה ועד f16 המלאה, כשמשקל כלל הקבצים יחד מגיע ל־22.2 גיגה בייט. גרסת כימות של 4 ביט תרוץ בלי בעיה על כרטיס מסך ביתי בודד עם 6 עד 8 גיגה בייט של זיכרון גרפי, ואפשר לגלגל אותה גם על מעבד רגיל.

אם אתם צריכים רק שאילתות בודדות פעם בכמה דקות או שאין לכם חומרה ייעודית זמינה, שווה לשקול פנייה ל־API חיצוני. הרצה מקומית משתלמת ברגע שאינדוקס המסמכים כולל מידע פנימי רגיש, או כשיש לכם תעבורה גבוהה של טקסטים שחבל לשלם עליה לפי טוקנים.

ollama run hf.co/Qwen/Qwen3-Embedding-4B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי שום דרישה לחלוק את הקוד שפיתחתם מסביב.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗