GPT
I

inf-retriever-v1-1.5b

קוד פתוח

inflyapache-2.02025-02-08

  • sentence-transformers
  • safetensors
  • qwen2
  • feature-extraction
  • transformers

מודל שיכון טקסט קומפקטי שמביא דיוק של מודלי ענק לחיפוש סמנטי באנגלית וסינית. הוא תופס פחות משלושה גיגה בייט ומיועד למערכות שצריכות שליפה מדויקת בלי שרתים מנופחים.

  • 1.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.9 GBמשקל הקבצים
  • 4,834הורדות בחודש

מה זה

מדובר במודל שיכון צפוף המבוסס על gte-Qwen2-1.5B-instruct, שעבר כוונון ייעודי למשימות אחזור מידע. הוא מחזיר וקטורים בגודל 1536 ממדים ומיועד בעיקר למי שבונה מנועי חיפוש פנימיים, מערכות שאלות ותשובות או שלב שליפה עבור יישומי שפה.

במדד AIR-Bench של פברואר 2025 המודל הגיע למקום הראשון בקטגוריית המודלים מתחת ל־7 מיליארד פרמטרים באנגלית וסינית עם ציון ממוצע של 49.77 בגרסה אחת ו־51.28 בגרסה מעודכנת יותר. המספרים האלה מראים שבשליפה מעשית הוא עוקף מודלים גדולים ממנו בהרבה כמו GTE-Qwen2-7B ו־E5-mistral-7b, בעיקר בתחומי משפטים ומאמרים מדעיים באנגלית שבהם שמר על פער ברור מול המתחרים.

מתאים ל

  • שליפה למערכות RAG

    הוא מציג ביצועים גבוהים באחזור מאמרים ומסמכי רשת באנגלית, תוך חיסכון ניכר במשאבי זיכרון.

  • חיפוש בטקסטים פיננסיים

    במבחני AIR-Bench המודל קיבל מעל 56 נקודות בנתונים פיננסיים באנגלית, מעל מתחרים כבדים ממנו.

  • אחזור מידע דו לשוני

    הוא אומן במיוחד על קורפוסים באנגלית ובסינית ומחזיר שיכונים מתואמים היטב בין שתי השפות.

איפה זה נופל

המודל עבר אימון ייעודי לאנגלית וסינית בלבד. למרות שבמדד הרב לשוני מדווחים ציונים סבירים בשפות נוספות, עברית אינה ברשימת השפות שבדקו, ולכן לא הייתי משתמש בו לחיפוש בעברית בלי בדיקה אמפירית מוקדמת.

בנוסף, יש סתירה בתיעוד לגבי אורך הקלט, המפרט הטכני מציין 131,072 טוקנים אך בתיאור המודל מצוין גבול של 32,768 טוקנים. אם אתם בונים על שיכון מסמכים שלמים וארוכים מאוד בבת אחת, תצטרכו לבדוק בעצמכם איפה הוא חותך בפועל.

אותה משפחה

inf-retriever יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לחיפוש מסמכים בעברית?

הכרטיס מפרט תמיכה באנגלית ובסינית, לצד תוצאות ב־13 שפות אחרות שלא כוללות עברית. מאחר והוא מבוסס על Qwen2 ייתכן שיש לו היכרות שטחית מסוימת עם השפה, אך הביצועים שלו בעברית לא נבדקו ואינם מובטחים.

איזה אורך קלט מקסימלי המודל מקבל?

מפרט הארכיטקטורה מציין תמיכה בחלון של 131,072 טוקנים, אך בגוף כרטיס המודל נכתב במפורש שהגבול הוא 32,768 טוקנים. מומלץ לקחת בחשבון את המגבלה הנמוכה יותר של 32,768 טוקנים כדי למנוע קיטום לא צפוי של טקסטים.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית sentence-transformers או דרך transformers הרגילה, כשהמשקלים יושבים בפורמט bfloat16. קבצי המודל שוקלים 2.9 גיגה בייט, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון יריץ אותו בקלות, ואפשר לדחוף אותו גם למעבד רגיל במכונות קטנות אם קצב השאילתות לא גבוה במיוחד.

הבחירה להריץ אותו בעצמכם מול פנייה ל־API חיצוני תלויה בעיקר בפרטיות המידע ובנפח השאילתות. אם אתם מעבדים מאגרי מסמכים פנימיים רגישים שאי אפשר להוציא החוצה, הגודל הקומפקטי שלו מאפשר פריסה מקומית זולה ויציבה בלי תלות ברשת.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("infly/inf-retriever-v1-1.5b")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, ושילוב שלהם במוצרים סגורים, בתנאי שאתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗