GPT
Q

Qwen3-Embedding-8B

קוד פתוח

Qwenapache-2.02025-06-03

  • sentence-transformers
  • safetensors
  • qwen3
  • text-generation
  • transformers

יש כאן גם סקירה על Qwen עצמו.

המודל מפיק וקטורים איכותיים מטקסט ארוך במיוחד ומדורג ראשון במבחני ביצועים רב־לשוניים. הוא מתאים למי שבונה חיפוש סמנטי מורכב ורוצה שליטה מלאה בנתונים בלי להסתמך על ספק חיצוני.

  • 7.6Bפרמטרים
  • 40,960טוקנים בהקשר
  • 14.1 GBמשקל הקבצים
  • 2,166,281הורדות בחודש

מה זה

מדובר במודל ייעודי להפקת וקטורים שמבוסס על משפחת המודלים הצפופים של קוון, והוא תומך ביותר ממאה שפות כולל שפות תכנות. המודל מתמודד עם טקסטים באורך של עד 32 אלף טוקנים בטבלה, או כארבעים אלף לפי נתוני המשקל, ומפיק וקטורים בגמישות מלאה בין 32 ל־4096 ממדים. התכונה הזו חוסכת שטח אחסון במסדי נתונים וקטוריים בלי לאבד את כל כוח הייצוג המקורי.

במבחני MTEB הרב־לשוניים הוא עוקף מודלים סגורים ופתוחים מובילים ומגיע לציון כללי של 70.58, בעיקר בזכות שיפור של ממש באיתור קטעים, כריית טקסט מקביל וסיווג. המבנה שלו מותאם להנחיות טקסטואליות מצד השאילתה, מה שמוסיף בין אחוז לחמישה אחוזי דיוק במשימות חיפוש מורכבות ביחס לעבודה בלי הנחיות. בהשוואה לדגמי העבר בגודל דומה הוא מוביל בפער ניכר על פני המתחרים הוותיקים ברמת הדיוק של אחזור המידע.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    הוא מטפל בעשרות אלפי טוקנים בבת אחת, ולכן חוסך פירוק מלאכותי של חוזים וספרים לקטעים קטנים מדי.

  • אחזור רב־לשוני וקוד

    הוא תומך ביותר ממאה שפות ומאפשר למצוא קטעי קוד או טקסטים בשפה אחת באמצעות שאילתה בשפה אחרת.

  • מסדי וקטורים חסכוניים

    התמיכה בחיתוך ממדים מאפשרת לשמור וקטורים קטנים מ־4096 ממדים ולהוזיל עלויות אחסון.

איפה זה נופל

הכרטיס ממליץ מפורשות לכתוב את פקודות ההנחיה באנגלית בלבד, מפני שכך המודל אומן. אם תשתמשו בהנחיות בעברית או בשפות אחרות, אתם מסתכנים בירידה של אחוז עד חמישה אחוזים ברמת הדיוק של האחזור. בנוסף, יש חוסר התאמה בין התיעוד שמציין חלון של 32 אלף טוקנים לבין המטא־דאטה שמציין 40,960 טוקנים, מה שמחייב בדיקת גבולות עצמאית. מודל 8B מייצר גם השהיה משמעותית ביחס למודלים קטנים, כך שהוא לא יתאים למערכות שדורשות זמני מענה של מילישניות בודדות.

אותה משפחה

Qwen3-Embedding יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון וידאו דרוש בפועל כדי להריץ אותו?

הקבצים עצמם שוקלים 14.1 ג'יגה־בייט בדיוק חצי. תצטרכו כרטיס עם 24 ג'יגה זיכרון וידאו לפחות כדי להריץ אותו בנוחות, במיוחד אם תשלחו טקסטים ארוכים שמנצלים את מלוא חלון ההקשר.

האם כדאי להגדיר לו הנחיות בעברית?

עדיף שלא. יוצרי המודל מדגישים שהאימון בוצע בעיקר על הנחיות באנגלית, ושם מתקבל שיפור הדיוק המרבי של עד חמישה אחוזים בתוצאות החיפוש.

איך מריצים

כדי להריץ מודל במשקל 14.1 ג'יגה־בייט בדיוק bfloat16 אתם צריכים מאיץ גרפי ייעודי עם לפחות 24 ג'יגה זיכרון וידאו, בטח אם אתם מתכוונים לנצל חלונות הקשר ארוכים בפועל. מריצים אותו ישירות בקונטיינר של ספריות הסקת וקטורים כמו TEI של האגינג פייס, או דרך vLLM וספריית sentence-transformers, עם גרסת transformers מודרנית כדי למנוע שגיאות זיהוי.

אם יש לכם עומסי עבודה קטנים או שאתם מחפשים לחסוך משאבים, עדיף להשתמש בגרסת ה־0.6B או בגרסת ה־4B של אותה סדרה במקום להחזיק שרת יקר. פנייה לשירות ענן מוכן עדיפה כשרק בודקים היתכנות, כי תחזוקה עצמית של מודל בגודל כזה דורשת חומרה שאינה זולה וניטור קבוע של זמני תגובה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Qwen/Qwen3-Embedding-8B")
v = m.encode(["שלום עולם"])

הרישיון

הקוד והמשקלים משוחררים תחת רישיון אפאצ'י 2.0. מותר להשתמש בהם ליישומים מסחריים, לשנות את הקבצים, להטמיע אותם במוצרים שלכם ולהפיץ אותם מחדש. הדרישות היחידות הן לצרף עותק של הרישיון המקורי ולציין שינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗