GPT
M

moondream1

קוד פתוח

vikhyatkרישיון לא דווח2024-01-20

  • transformers
  • pytorch
  • safetensors
  • moondream1
  • text-generation

מודל ראייה ושפה קטן במיוחד שנועד לענות על שאלות על תמונות בלי לחנוק את המעבד. אם אתם צריכים הבנת תמונה בסיסית על חומרה מקומית צנועה, שווה לבדוק אותו.

  • 1.9Bפרמטרים
  • 22.0 GBמשקל הקבצים
  • 15,877הורדות בחודש
  • 487לייקים

מה זה

מדובר בשילוב חכם בין מודל הראייה SigLIP למודל השפה Phi-1.5, שאומן על נתוני LLaVA ומגיע לקצת פחות משני מיליארד פרמטרים. הרעיון פה הוא לקחת תמונה, לקודד אותה, ולתת למודל השפה לחלץ תיאורים או לענות על שאלות ישירות לגבי מה שרואים בפריים, באנגלית בלבד.

במבחני ביצועים רואים בדיוק איפה הוא עומד מול ענקים כמו LLaVA-1.5. במשימות זיהוי כללי ושאלות ויזואליות הוא משיג 74.7 ב־VQAv2 לעומת כ־80 במודלים של 13 מיליארד פרמטרים, שזה קרוב באופן מפתיע. אבל כשמגיעים לקריאת טקסט מתוך תמונה ב־TextVQA, הוא צונח לציון של 35.6, בזמן שהגדולים עוברים את ה־60.

מתאים ל

  • תיאור תמונות בסיסי

    זיהוי אובייקטים ופעולות בתמונה באנגלית על חומרה מקומית חלשה יחסית.

  • מענה לשאלות על סצנה

    בירור פרטים ויזואליים כלליים כמו צבע רכב או מיקום אדם בלי להפעיל מודל ענק.

  • מחקר וניסויים מקומיים

    בדיקת יכולות של מודלי ראייה קומפקטיים למטרות אקדמיות וללא עלויות ענן.

איפה זה נופל

הקריאה מתוך תמונות חלשה מאוד, והציון הנמוך במבחני TextVQA מראה שהוא מתקשה לחלץ טקסטים קטנים או שלטים. הוא מאומן באנגלית בלבד, כך שאין מה לבנות עליו לעברית או לזיהוי שלטי רחוב מקומיים. בנוסף, הקוד דורש הרצת קוד מרוחק מהמאגר, שזה משהו שצוותי אבטחה בדרך כלל לא אוהבים לראות.

שאלות
נפוצות

אפשר להשתמש בו לקריאת קבלות או מסמכים?

עדיף שלא. המודל קיבל ציון נמוך מאוד של 35.6 במבחן TextVQA שמודד חילוץ טקסט מתמונה, והוא פשוט יפספס יותר מדי פרטים קריטיים.

למה ההורדה שוקלת 22 ג'יגה אם המודל כל כך קטן?

המשקלים במאגר שמורים בפורמט float16 ומפוצלים לעשרות קבצים שמכילים גם את מקודד התמונה וגם את מודל השפה. זה דורש חיבור מהיר ומקום בדיסק רק בשביל ההורדה.

הוא מבין שאלות בעברית על התמונה?

לא. המודל אומן על מאגרי נתונים באנגלית בלבד ואין לו תמיכה רשמית בעברית, לא בקלט של השאלה ולא בתשובות שהוא מחזיר.

איך מריצים

כדי להריץ אותו צריך transformers יחד עם einops ו־timm, וטעינה ישירה של המשקלים דרך הקוד עם הרשאת trust_remote_code. למרות שמדובר במודל של 1.9 מיליארד פרמטרים שרץ בכיף על כרטיס מסך ביתי קטן ואפילו על מעבד רגיל, ההורדה הראשונית כבדה וכוללת 22 ג'יגה-בייט שמפוזרים על 34 קבצים.

הקריאה מתבצעת בשני שלבים, קידוד התמונה ואז העברת השאלה למתודת הייעודית. אם אין לכם סבלנות להוריד את כל הנפח הזה בשביל בדיקה ראשונית, עדיף פשוט להתנסות במרחב הציבורי שהועלה ל־Hugging Face Spaces.

from transformers import pipeline

pipe = pipeline("text-generation", model="vikhyatk/moondream1")
print(pipe("שלום"))

הרישיון

היוצר מציין בפירוש בעמוד שהמודל מיועד למטרות מחקר בלבד ואינו מאושר לשימוש מסחרי, למרות שבשדות המטא-דאטה לא הוגדר רישיון רשמי. אם תכננתם לשלב אותו במוצר שמכניס כסף או לפתוח סביבו שירות בתשלום, כרגע זה פשוט אסור.

הרישיון המלא בעמוד המודל ↗