GPT
Q

Qwen3-Embedding-8B-GGUF

קוד פתוח

Qwenapache-2.02025-06-05

  • gguf
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל וקטורי בקוד פתוח עם חלון של 32 אלף טוקנים וביצועים מעולים בשפות מרובות. הוא מתאים למי שבונה חיפוש סמנטי או RAG ומחפש אלטרנטיבה עצמאית לשירותים סגורים.

  • 41.7 GBמשקל הקבצים
  • 34,542הורדות בחודש
  • 139לייקים

מה זה

מדובר במודל וקטורי של 8 מיליארד פרמטרים שממיר טקסט למרחב סמנטי בגודל של עד 4096 ממדים. היתרון המעשי כאן הוא התמיכה בקיצוץ ממדים מותאם אישית בין 32 ל־4096, לצד היכולת לבלוע מסמכים ארוכים מאוד בתוך חלון של 32 אלף טוקנים בלי לחתוך אותם לחתיכות קטנות מדי.

במבחן MTEB הרב־לשוני המודל תפס את המקום הראשון עם ציון 70.58, כשהוא עוקף מודלים סגורים כמו של Cohere ו־OpenAI. בפועל, המספר הזה מעיד על יכולת אחזור מדויקת בהרבה בשפות שאינן אנגלית, כולל משימות של חיפוש קוד, סיווג וכריית טקסט מקביל.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    חלון של 32k טוקנים מאפשר לאנדקס חוזים, מאמרים ודוחות מלאים בלי לקטוע את ההקשר.

  • מערכות RAG רב־לשוניות

    התוצאות הגבוהות ב־MTEB נותנות דיוק מעולה באחזור טקסטים בשפות שונות וחיפוש מוצלב ביניהן.

  • אחזור וניתוח של מאגרי קוד

    הוא אומן על שפות תכנות ומתאים לחיפוש רכיבי קוד על בסיס תיאור מילולי או קטעי קוד אחרים.

איפה זה נופל

המודל רגיש מאוד להוראות החיפוש. המפתחים עצמם מבהירים שאי־שימוש בטקסט הנחיה בצד השאילתה מוריד בין 1% ל־5% מביצועי האחזור, ודורש לכתוב את ההנחיות באנגלית כדי לקבל דיוק מרבי, גם כשעובדים בשפות אחרות. בנוסף, מודל אמבדינג של 8 מיליארד פרמטרים הוא עדיין כבד ואיטי משמעותית ממודלים זעירים של מאות מיליוני פרמטרים, ולא הייתי בוחר בו למערכת שדורשת זמני מענה של מילישניות בודדות.

אותה משפחה

Qwen3-Embedding יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש בו ישירות או להוסיף reranker?

הוא מתפקד מצוין לבד, אבל בסדרת Qwen3 יצא גם מודל reranker ייעודי. שילוב של שניהם ייתן תוצאות מדויקות יותר באחזור סופי, במחיר של עוד זמן חישוב.

איך משפיע שינוי ממד הווקטור על הביצועים?

המודל תומך בבחירת ממד בין 32 ל־4096. שמירה על 4096 תיתן דיוק מקסימלי, אך חיתוך לממדים נמוכים יותר חוסך נפח אחסון יקר בבסיס הנתונים הוקטורי עם פגיעה מדודה בדיוק.

איך מריצים

את קובצי ה־GGUF מריצים ישירות עם llama.cpp או שרת llama-server מובנה, עם דגלי פקודה ייעודיים לאמבדינג ופול מסוג last. מבחינת קוונטיזציה יש מנעד רחב מ־q4_K_M ועד f16, כך שגרסת 4 ביט תרוץ בנוחות על כרטיס מסך בודד עם 8 עד 10 גיגה זיכרון, בעוד גרסת הדיוק המלא דורשת משאבים כבדים בהרבה.

אם יש לכם עומסי קריאה רגעיים קיצוניים בלי חומרה ייעודית צמודה, החזקת שרת כזה תעלה יותר מ־API מנוהל. אבל לצורכי פרטיות מידע ואחזור לוקאלי מהיר, הרצה מקומית של גרסת ה־q5 או ה־q4 סוגרת את הפינה.

ollama run hf.co/Qwen/Qwen3-Embedding-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, להטמיע במוצרים סגורים ולהפיץ הלאה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗