GPT
H

harrier-oss-v1-0.6b

קוד פתוח

microsoftmit2026-03-30

  • sentence-transformers
  • safetensors
  • qwen3
  • feature-extraction
  • mteb

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל שיכוך רב-לשוני קומפקטי שמייצר וקטורים איכותיים גם לטקסטים ארוכים. הוא מציע דיוק גבוה ביחס למשקל של ג'יגה בודד.

  • 596Mפרמטרים
  • 32,768טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 245,922הורדות בחודש

מה זה

מדובר במודל וקטורי מבוסס ארכיטקטורת דקודר של Qwen3 עם 596 מיליון פרמטרים, שמיועד לחילוץ מאפיינים ומייצר וקטורים בגודל 1,024 ממדים. הוא אומן בלמידה ניגודית ועבר זיכוך ידע ממודלים כבדים בהרבה. השילוב הזה נותן לו ציון של 69.0 במבחן MTEB v2 הרב-לשוני, שזה פער קטן מאוד מול גרסת ה־27B שהגיעה ל־74.3, אבל בשבריר מהגודל ודרישות החומרה.

בניגוד למודלי שיכוך ישנים שמוגבלים לטקסטים קצרים, כאן יש חלון של 32,768 טוקנים ותמיכה מובנית בעשרות שפות, כולל עברית וערבית. הוא מתאים למשימות אחזור, סיווג, דמיון סמנטי ודירוג מחדש. המודל מסתמך על איחוד לפי הטוקן האחרון ונרמול L2, כך שהוא מוציא ייצוג צפוף שמוכן ישר לחיפוש וקטורי.

מתאים ל

  • חיפוש מסמכים ארוכים

    חלון של 32K טוקנים קולט חוזים ומאמרים שלמים בלי לחתוך אותם למקטעים קטנים.

  • שליפת מידע היברידית

    וקטורים של 1,024 ממדים נותנים רמת דיוק טובה בחיפוש סמנטי למערכות RAG.

  • סיווג טקסטים בעברית

    התמיכה המובנית בשפות שונות מאפשרת לקבץ ולסווג פניות ותוכן מקומי בזול.

איפה זה נופל

חייבים להוסיף הוראה קצרה באנגלית לפני כל שאילתה כדי לקבל תוצאות מדויקות, כי ככה אימנו אותו. בלי פרומפט מתאים, רמת הדיוק של הווקטורים יורדת. למסמכים עצמם לא צריך להוסיף הנחיות כאלה.

למרות התמיכה הרשמית בעברית, המודל אומן על עשרות שפות במקביל ובנוי בזיכוך, לכן צריך לבדוק אותו על מאגר הטקסטים המקומי שלכם לפני שמסתמכים עליו בחיפוש קריטי.

אותה משפחה

harrier-oss יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

חייבים להוסיף טקסט מקדים לשאילתות חיפוש?

כן. המודל אומן לקבל הנחיה של משפט אחד שמגדיר את המשימה לפני השאילתה עצמה. בלי זה הביצועים נפגעים, אבל למסמכים שמאנדקסים לא צריך להוסיף כלום.

איך המודל מחשב את הווקטור הסופי של הטקסט?

הוא משתמש בייצוג של הטוקן האחרון שאינו ריק ומבצע עליו נרמול L2. אם אתם עובדים עם sentence-transformers, הספרייה עושה את החישוב הזה אוטומטית.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers או transformers. עם משקל של 1.1 ג'יגה-בייט ו־28 שכבות, הוא רץ בלי למצמץ על כרטיס מסך בסיסי עם 2 עד 4 ג'יגה זיכרון, וגם על מעבד רגיל בשרת פשוט הוא יחזיר תשובות בזמן סביר.

אם יש מגבלת זיכרון קיצונית, גרסת ה־270M שוקלת פחות אבל מאבדת 2.5 נקודות בדיוק. שירותי API של חברות ענן שווים בדיקה רק כשרוצים לחסוך תחזוקת שרתים לגמרי, כי מבחינת עלויות חומרה המודל הזה כל כך קל שאין סיבה אמיתית לא להרים אותו לבד.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("microsoft/harrier-oss-v1-0.6b")
v = m.encode(["שלום עולם"])

הרישיון

רישיון MIT מלא. אפשר להשתמש בו לכל מטרה, כולל מוצרים מסחריים סגורים ושינויים בקוד, בלי לשלם תמלוגים ובלי חובת שיתוף. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית של מיקרוסופט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗