GPT
Q

Qwen3-Embedding-0.6B

קוד פתוח

Qwenapache-2.02025-06-03

  • sentence-transformers
  • safetensors
  • qwen3
  • text-generation
  • transformers

יש כאן גם סקירה על Qwen עצמו.

מודל וקטורי קומפקטי במיוחד שמביא תמיכה בטקסטים ארוכים וביצועי חיפוש מרשימים לגודלו. אתם מקבלים איכות שמתחרה במודלים כבדים בהרבה, בלי לחנוק את השרת.

  • 596Mפרמטרים
  • 32,768טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 7,495,042הורדות בחודש

מה זה

המודל מפיק וקטורים לייצוג טקסט ומיועד בעיקר לחיפוש, סיווג וקיבוץ נתונים בלמעלה ממאה שפות כולל קוד. למרות שהוא שוקל רק 1.1 ג'יגה בייט ומחזיק 596 מיליון פרמטרים, הוא תומך בהקשר של 32,768 טוקנים, נתון נדיר בקטגוריית המשקל הזו שמתאימה בדרך כלל לטקסטים קצרים בלבד.

במבחני MTEB הרב-לשוניים הוא עוקף מודלים ותיקים באותו סדר גודל כמו BGE-M3 ו־multilingual-e5-large עם ציון ממוצע של 64.33, ומשאיר מאחור אפילו מודלים סגורים כמו text-embedding-3-large בתחום השליפה. תכונה שימושית כאן היא MRL, שמאפשרת לכם לקצר את ממד הווקטור מ־1024 עד ל־32 בלבד כדי לחסוך מקום במסד הנתונים בלי לאמן שום דבר מחדש.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    חלון של 32 אלף טוקנים מאפשר לאנדקס חוזים ומאמרים שלמים בלי לחתוך אותם לפסקאות קטנות.

  • חיפוש קוד מקור

    הוא אומן על שפות תכנות ומתאים לשליפת פונקציות וקטעי קוד רלוונטיים לפי שאילתות מילוליות.

  • מערכות עם מסדי וקטורים מוגבלים

    התמיכה בחיתוך ממדים מאפשרת לשמור וקטורים של 256 או 128 ערכים בלבד ולחסוך המון זיכרון ואחסון.

איפה זה נופל

היוצרים מציינים במפורש שהמודל דורש הוראות באנגלית כדי להגיע לביצועים המרביים שלו, ובלעדיהן הדיוק בשליפה יורד בעד 5 אחוזים. מעבר לכך, במבחני כריית טקסט מקביל (Bitext Mining) הוא משיג תוצאה של 72.22, שזה נמוך יותר מ־BGE-M3 הוותיק. אם אתם עובדים עם ספריות transformers ישנות מגרסה 4.51.0, הקוד פשוט יזרוק שגיאה ולא יזהה את הארכיטקטורה.

אותה משפחה

Qwen3-Embedding יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מספיק קטן בשביל לרוץ על מעבד רגיל בלי כרטיס מסך?

כן. עם גודל קובץ של 1.1 ג'יגה בייט ופחות מ־600 מיליון פרמטרים, קונטיינר רגיל של TEI מייצר וקטורים על CPU בקצב סביר מאוד ליישומים שאינם דורשים זמן תגובה של אלפיות השנייה.

חייבים לכתוב הוראה מיוחדת לפני כל טקסט שמחפשים?

לא חייבים, אבל הדף הרשמי מזהיר שאי-שימוש בהוראה מפיל את דיוק החיפוש ב־1 עד 5 אחוזים. הם ממליצים להוסיף הוראה קצרה באנגלית שמגדירה את המשימה לפני השאילתה עצמה.

איך מריצים

בגלל המשקל הנמוך שלו אפשר להריץ אותו ישירות על מעבד פשוט או על כרטיס מסך ביתי בסיסי ביותר באמצעות ספריות כמו vLLM, sentence-transformers או קונטיינר של TEI. הוא דורש בערך 2 ג'יגה זיכרון עבודה כדי לרוץ בצורה חלקה, כך שאין צורך בתשתיות ענן יקרות.

אם אתם צריכים לאנדקס מסמכים בודדים פעם ביום, אין סיבה להחזיק שרת דלוק ועדיף לשלם לפי קריאה לשירות חיצוני. אבל ברגע שיש נפח קבוע או שאתם לא רוצים שהטקסטים ייצאו מהרשת הפנימית, ההרצה העצמית שלו זולה ופשוטה להפליא.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Qwen/Qwen3-Embedding-0.6B")
v = m.encode(["שלום עולם"])

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצר שלכם ולהפיץ אותו חופשי, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗