GPT
C

colqwen-omni-v0.1

קוד פתוח

vidoremit2025-07-14

  • colpali
  • safetensors
  • sentence-transformers
  • multi-vector
  • vidore

מודל חיפוש ואחזור שממיר דפי מסמכים והקלטות שמע לייצוגים רב-וקטוריים ישירות מתוך התמונה או הצליל. הוא פותר את הצורך בחילוץ טקסט ובתמלול מוקדם כשרצים על מאגרים עמוסים.

  • 931 MBמשקל הקבצים
  • 3,175הורדות בחודש
  • 95לייקים

מה זה

במקום להריץ מנועי קריאת טקסט מתמונה או מערכות תמלול לשמע, המודל הזה מתבסס על Qwen2.5-Omni-3B ומיישם גישת הצלבה מאוחרת בסגנון ColBERT. הוא יוצר ייצוג רב וקטורי מתוך מאפיינים חזותיים של עמודי מסמכים או מקטעי שמע, ומשווה אותם ישירות לשאילתות טקסטואליות. הוא מנהל רזולוציות תמונה דינמיות בלי לעוות את יחס הגובה והרוחב, ומייצר עד 1024 מקטעי תמונה לכל עמוד כדי לשמור על קריאות ופרטים גרפיים.

הבסיס אומן על מאגר של 127,460 זוגות של שאילתה ועמוד, שמתוכם 63 אחוזים הגיעו ממאגרים אקדמיים פתוחים ו־37 אחוזים ממסמכי רשת מסונתזים עם שאלות שנבנו על ידי מודל חיצוני. מעניין לראות שיכולות אחזור השמע פועלות כאן באפס דוגמאות מראש, בלי שהמודל ראה דוגמאות שמע באימון הייעודי, אלא רק מתוך חיבור הייצוגים של המודל המקורי שהוקפא בחלקים אלה.

מתאים ל

  • אחזור מסמכים מורכבים

    חיפוש בתוך דוחות עם תרשימים וגרפיקה ישירות מהתמונה בלי להסתבך עם קריאת טקסט לקויה.

  • אינדוקס הקלטות קוליות

    איתור קטעי שמע לפי שאילתות טקסט בלי לבצע תמלול מלא של כל ההקלטה מראש.

  • סריקת קובצי PDF היברידיים

    מעבר על עמודים שמשלבים כתב ואיורים ברזולוציה גמישה ששומרת על היחס המקורי.

איפה זה נופל

האימון נעשה אך ורק על חומרים באנגלית, מה שאומר שכל עבודה עם עברית מתבססת אך ורק על מה שהמודל המקורי ספג במקרה. חיפוש בעברית במסמכים מקומיים עלול לפספס מונחים ולתת תוצאות לא יציבות. בנוסף, חלקי השמע והראייה הוקפאו באימון והיכולת הקולית פועלת באפס דוגמאות, כך שלא הייתי בונה עליו לאחזור שמע רגיש או רועש בלי לבדוק את זה לעומק קודם.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לחיפוש מסמכים בעברית?

האימון הייעודי נעשה כולו באנגלית כדי לבחון יכולת הכללה. כל תמיכה בעברית מגיעה מאימון הבסיס הכללי ולא נבדקה כאן ישירות, לכן חייבים לבדוק על מדגם אמיתי לפני שמסתמכים עליו.

איך מטפלים באודיו לפני שמעבירים אותו למודל?

המודל דורש מקור שמע בקצב דגימה של 16 קילוהרץ. יש להמיר את ההקלטות לערך הזה לפני השליחה, והרכיב הקולי ינתב אותן אוטומטית.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית colpali-engine מגרסה 0.3.11 ומעלה, או להשתמש ב־Sentence Transformers מגרסה 6 ומעלה עם תמיכה במולטימדיה. קובצי המודל שוקלים 931 מגה בייט, כך שלא צריך שרת מפלצתי כדי לטעון אותו לזיכרון וכרטיס מסך פשוט יספיק פה לעבודה שוטפת.

אם עובדים עם שמע, חובה להמיר את קובצי הקול לקצב דגימה של 16 קילוהרץ לפני שמעבירים אותם למודל כדי שהרכיב הייעודי יפענח אותם נכון. גודל הווקטורים משתנה מדף לדף ונשען על פונקציית MaxSim לחישוב הדמיון, כך שצריך לוודא שמסד הנתונים הווקטורי שלכם יודע להתמודד עם אינדקס מרובה וקטורים.

pip install -U huggingface_hub
hf download vidore/colqwen-omni-v0.1

הרישיון

הרישיון הוא MIT, מה שאומר שאפשר להשתמש בו חופשי, לשלב אותו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים של היוצרים המקוריים בכל עותק של הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗