GPT
B

BidirLM-Omni-2.5B-Embedding

קוד פתוח

BidirLMapache-2.02026-04-07

  • sentence-transformers
  • safetensors
  • bidirlm_omni
  • mteb
  • transformers

מודל שיודע לנעוץ טקסט, תמונה ואודיו באותו מרחב וקטורי בדיוק. אם אתם בונים חיפוש שמשלב מדיה ולא רק מילים, זה חוסך תחזוקה של שלושה מודלים נפרדים.

  • 2.4Bפרמטרים
  • 4.6 GBמשקל הקבצים
  • 1,575הורדות בחודש
  • 49לייקים

מה זה

מדובר באנקודר דו כיווני עם 2.4 מיליארד פרמטרים, שמבוסס במקור על Qwen3 ומייצר וקטורים בגודל 2048 ממדים. הייחוד פה הוא היכולת לקבל טקסט בעד 32 אלף תווים, תמונה או קובץ קול, ולהוציא לכולם ייצוג שמאפשר לחשב מרחק ביניהם ישירות עם דמיון קוסינוס.

רוב מודלי השיבוץ יודעים להתמודד רק עם טקסט, או לכל היותר עם טקסט ותמונה כמו ברוב יישומי קליפ. כאן יש תמיכה באודיו שמנורמל אוטומטית לשישה עשר קילוהרץ, לצד תמיכה בלמעלה ממאה ותשע עשרה שפות, כך שאפשר לחפש בטקסט חופשי קטעי דיבור או תמונות בלי מתווכים.

מתאים ל

  • חיפוש חוצה מדיה

    שליפת תמונות והקלטות שמע ישירות מתוך שאילתת טקסט חופשי, בלי להמיר את הסאונד למלל תחילה.

  • איחוד וקטורי במערכות RAG

    שמירת מסמכים שכוללים דיאגרמות, פודקאסטים וטקסט בתוך אינדקס וקטורי אחד של אלפיים ארבעים ושמונה ממדים.

  • קלאסטרינג של תוכן מעורב

    חלוקה לקבוצות דמיון של פריטים הכוללים שיחות מוקלטות, צילומי מסך וטקסטים בלי מודל נפרד לכל סוג קובץ.

איפה זה נופל

ההרצה מחייבת הפעלה של קוד מרוחק עם trust_remote_code, מה שמחייב בדיקת אבטחה לפני שמעלים אותו לשרתי ייצור. בנוסף, עיבוד אודיו ותמונה דורש תלויות כבדות כמו librosa שמבצעות המרות ודגימות מחדש בזמן אמת, מה שעלול לייצר צוואר בקבוק משמעותי בזמני תגובה תחת עומס.

שאלות
נפוצות

האם אפשר להשוות וקטור של קובץ שמע ישירות לוקטור של טקסט?

כן. כל סוגי הקלט מתורגמים לאותו מרחב וקטורי של אלפיים ארבעים ושמונה ממדים. אפשר לחשב ישירות דמיון קוסינוס בין טקסט, תמונה או אודיו.

איזה פורמט אודיו המודל מוכן לקבל?

המודל מקבל מערכי NumPy, רשימות ערכים של דגימות, או אובייקטים של האגינג פייס. ברקע מתבצעת המרה לתדר של שישה עשר קילוהרץ באמצעות ספריית librosa.

איך מריצים

המשקל יושב על ארבעה נקודה שישה גיגהבייט, כך שהוא נכנס בקלות לכרטיס מסך בודד עם שמונה או שנים עשר גיגה זיכרון. מריצים אותו ישירות מתוך ספריית sentence transformers עם פקודת encode רגילה, לצד librosa שדואגת לעיבוד האודיו.

שימו לב שחובה לעבוד עם דרייברים מעודכנים וגרסת cuDNN מעל 9.20.0, אחרת באג ידוע בחישובי Conv3D של כרטיסי אנבידיה ירסק לכם את הביצועים. אם אין לכם תשתית עם מעבד גרפי מתאים ועדכני, החזקה עצמית של המודל תהיה איטית ומסורבלת.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("BidirLM/BidirLM-Omni-2.5B-Embedding")
v = m.encode(["שלום עולם"])

הרישיון

המודל משוחרר תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו, כל עוד שומרים על תנאי הרישיון המקורי ומתן קרדיט ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗