GPT
Q

Qwen3-Embedding-0.6B-GGUF

קוד פתוח

Qwenapache-2.02025-06-05

  • gguf
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל וקטורי קל משקל שמספק חלון הקשר ענק של 32 אלף טוקנים ותמיכה בהוראות חיפוש מותאמות. הוא פותר את בעיית הזיכרון בשרתים קטנים בלי לוותר על דיוק גבוה בשליפת טקסט וקוד.

  • 1.7 GBמשקל הקבצים
  • 103,084הורדות בחודש
  • 571לייקים

מה זה

מדובר במודל שיודע לייצר וקטורים מטקסט ומקוד בלמעלה ממאה שפות שונות. המאפיין הייחודי ביותר שלו ביחס לגודלו הוא היכולת לחתוך את גודל הווקטור לכל אורך שתרצו בין 32 ל־1024 ממדים, מה שמאפשר לצמצם דרסטית את נפח בסיס הנתונים הווקטורי שלכם.

במדדי ביצועים רב־לשוניים כמו MTEB, המודל עוקף מודלים ותיקים באותו סדר גודל כמו BGE-M3 ו־multilingual-e5-large עם ציון ממוצע של 64.33. למרות שהוא קטן משמעותית ממודלים מסחריים סגורים, ציון השליפה שלו במבחן הרב־לשוני עומד על 64.64, נתון שהופך אותו לבחירה מעשית למערכות מקומיות.

מתאים ל

  • חיפוש מסמכים וקוד

    שליפת קטעי קוד וטקסט טכני מתוך מאגרים מקומיים, בעזרת תמיכה בחלון הקשר ארוך של 32 אלף טוקנים.

  • אחסון וקטורי מוגבל

    צמצום ממדי הווקטור עד ל־32 כדי לחסוך מקום יקר בזיכרון של מסד הנתונים בלי לאבד שליטה.

  • מערכות RAG מקומיות

    מודל קל להטמעה בשרתים מקומיים שאינם כוללים מאיץ גרפי חזק, לצורך תשאול מאגרי ידע פנימיים.

איפה זה נופל

היוצרים מבהירים במפורש שאי שימוש בהנחיית שאילתה גורם לנפילה של אחוז עד חמישה אחוזים ברמת הדיוק, וכי רצוי לכתוב את ההנחיות הללו באנגלית בלבד. אם תזינו שאילתות בעברית בלי הוראה מקדימה באנגלית, אתם מאבדים מיעילות השליפה. בנוסף, משימות סיכום מקבלות ציון חלש של 33.43 במבחנים, וביצועי הדירוג מחדש שלו נופלים משמעותית מאחיו הגדולים בסדרה.

אותה משפחה

Qwen3-Embedding יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך משפיעה כתיבת ההנחיות באנגלית על שאילתות בעברית?

המודל מבין עברית היטב, אבל תבניות המשימה שלו אומנו בעיקר באנגלית. הוספת הנחיה כללית באנגלית בתחילת השאילתה, אפילו כשהטקסט עצמו בעברית, משפרת את דיוק השליפה בעד חמישה אחוזים לפי מדידות היוצרים.

האם כדאי להקטין את ממד הווקטור מ־1024 לערך נמוך יותר?

אם בסיס הנתונים שלכם סובל ממגבלות זיכרון או שאתם מחפשים מהירות מרבית, חיתוך הממדים יחסוך שטח אחסון משמעותי. עם זאת, כל חיתוך מוריד מעט את רמת הדיוק, לכן כדאי לבדוק את האיכות ביישום שלכם לפני שבוחרים ממד נמוך מאוד כמו 32 או 128.

איך מריצים

המודל מגיע בפורמט GGUF בגרסאות q8_0 ו־f16, ומתאים ישירות להרצה עם llama.cpp, בין אם מפקודת שורת פקודה ובין אם כשרת מקומי. עם משקל של 1.7 גיגה־בייט בלבד, הוא ירוץ בקלות על מעבד רגיל, לפטופ פיתוח או כרטיס גרפי בסיסי ביותר, ללא צורך בתשתית יקרה.

אין סיבה לשלם על API חיצוני כשאתם צריכים תפוקה יציבה בעלות אפסית או כשהמידע רגיש ולא יכול לצאת מהרשת המקומית. פנייה לשירות ענן תהיה עדיפה רק אם אתם לא רוצים לתחזק תהליך רקע בעצמכם או שאתם צריכים אינדוקס מסיבי וחד פעמי שדורש רוחב פס קיצוני.

ollama run hf.co/Qwen/Qwen3-Embedding-0.6B-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

4 קבצים במאגר, 1.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין לכל מטרה, כולל מוצרים מסחריים מסחריים והפצה ללקוחות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון תנאי הרישיון המקורי, בלי חובה לחשוף את קוד המקור של היישום שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗