GPT
Q

Qwen3-Embedding-4B

קוד פתוח

Qwenapache-2.02025-06-03

  • sentence-transformers
  • safetensors
  • qwen3
  • text-generation
  • transformers

יש כאן גם סקירה על Qwen עצמו.

אם אתם צריכים וקטורים איכותיים בטקסטים ארוכים ובמגוון שפות בלי לשלם על מודל 8B ענק, הגרסה הזו נותנת פשרה חזקה מאוד בין ביצועים למשאבים.

  • 4Bפרמטרים
  • 40,960טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 2,615,481הורדות בחודש

מה זה

מדובר במודל וקטורי מבוסס Qwen3 שתומך ביותר ממאה שפות כולל שפות תכנות, עם ארכיטקטורה צפופה של 36 שכבות. היתרון הבולט שלו הוא תמיכה בטכנולוגיית MRL, שמאפשרת לכם לחתוך את ממד הווקטור מ־2560 למספר נמוך יותר עד 32 בהתאם לאילוצי האחסון שלכם בבסיס הנתונים.

במדד MTEB הרב-לשוני הוא מציג ציון ממוצע של 69.45 ומנצח מודלים ותיקים גדולים יותר כמו NV-Embed-v2 וגם שירותים מסחריים כמו gemini-embedding-exp-03-07. בחיפוש מבוסס הוראות הוא מגיע לציון 11.56, גבוה משמעותית מגרסת ה־8B שלו ומכל מתחרה אחר בלוח התוצאות.

מתאים ל

  • חיפוש בקוד פתוח וספריות

    הוא אומן על שפות תכנות רבות ומתאים לשליפת קטעי קוד מתוך מאגרים גדולים.

  • מערכות RAG מרובות שפות

    התמיכה ביותר ממאה שפות ודירוג גבוה ב־MTEB מאפשרים לאחזר מסמכים בלי תרגום מוקדם.

  • אינדוקס מסמכים ארוכים

    חלון הקשר של עשרות אלפי טוקנים מאפשר לקלוט פרקים שלמים בלי לחתוך מוקדם מדי.

איפה זה נופל

היוצרים מבהירים שהמודל אומן בעיקר על הוראות באנגלית, ולכן בשאילתות רב-לשוניות מומלץ לנסח את ההוראה עצמה באנגלית כדי לא לאבד דיוק. בנוסף, אם לא תספקו הוראה מפורשת בצד השאילתה, הביצועים במשימות שליפה יורדים בין אחוז לחמישה אחוזים. קיימת גם דרישת תלות קשיחה בגרסת transformers 4.51.0 ומעלה, שבלעדיה הקוד קורס עם שגיאת מפתח.

אותה משפחה

Qwen3-Embedding יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה גודל וקטור כדאי להגדיר בבסיס הנתונים?

ברירת המחדל היא 2560, אבל הודות לתמיכה ב־MRL אפשר לקבוע ממד נמוך יותר כמו 1024 או 512. כדאי לבדוק את איכות השליפה מול נפח האחסון והזיכרון בבסיס הנתונים הוקטורי שלכם.

האם חובה להוסיף טקסט הוראה בכל שאילתה?

החוקרים מצאו שאי-שימוש בהוראה בצד השאילתה מוריד בין אחוז לחמישה אחוזים מדיוק השליפה. עדיף להוסיף הוראה קצרה באנגלית שמגדירה את מטרת החיפוש.

האם גרסת ה־4B עדיפה על גרסת ה־8B הגדולה?

במשימת חיפוש לפי הוראות גרסת ה־4B קיבלה ציון 11.56 מול 10.06 של ה־8B. ביתר המדדים ה־8B מוביל בפער קטן מאוד, כך שעבור רוב השימושים ה־4B נותן תמורה טובה בהרבה לחומרה.

איך מריצים

המשקל הגולמי של הקבצים עומד על 7.5 גיגה-בייט בפורמט bfloat16. להרצה מהירה תצטרכו כרטיס מסך עם לפחות 16 גיגה-בייט VRAM, במיוחד אם תנצלו את מלוא אורך ההקשר. אפשר להרים אותו ישירות דרך קונטיינר של Hugging Face Text Embeddings Inference או בספריית sentence-transformers, עם תמיכה גם בהרצה על מעבד אם אין דרישה לזמני תגובה מהירים.

גרסת ה־0.6B מתאימה למי שרץ בסביבת קצה מוגבלת מאוד, ואילו גרסת ה־8B מוסיפה עוד אחוז או שניים בביצועים במחיר של הכפלת דרישות החומרה. אם אין לכם תשתית שרתים פעילה עם כרטיסי מסך, החזקה עצמית תעלה יותר משימוש ב־API חיצוני.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Qwen/Qwen3-Embedding-4B")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לפרויקטים מסחריים, לשנות את הקוד ולהפיץ אותו במוצר שלכם, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗