GPT
M

moondream2

קוד פתוח

vikhyatkapache-2.02024-03-04

  • transformers
  • safetensors
  • moondream1
  • text-generation
  • image-text-to-text

מודל ראייה ושפה קטן של פחות משני מיליארד פרמטרים, שנבנה לרוץ מקומית בלי לחנוק את החומרה. הוא מתאים למי שצריך ניתוח תמונות מהיר וזול על מכשיר קצה או שרת צנוע.

  • 1.9Bפרמטרים
  • 3.6 GBמשקל הקבצים
  • 1,615,184הורדות בחודש
  • 1,435לייקים

מה זה

מדובר במודל ראייה שמשלב עיבוד תמונה ויצירת טקסט סביב 1.9 מיליארד פרמטרים. המטרה שלו פשוטה, לתת מענה לשאלות על תמונות, תיוג, זיהוי אובייקטים ומסמכים, בלי לסחוב משקלים של עשרות גיגה-בייט. בעדכונים האחרונים הוסיפו לו מצב הסקה מרחבי שמחבר את התשובה למיקום האובייקט, מה שעוזר לו בספירה ובקריאת תרשימים.

התוצאות שלו מראות שיפור עקבי במשימות ספציפיות. במבחן ScreenSpot לאיתור רכיבי ממשק משתמש הוא עלה מציון של שישים נקודה שלוש לשמונים נקודה ארבע, ובבדיקות כמו ChartQA לקריאת גרפים הוא מגיע ל־77.5 ועד 82.2. המשמעות היא שהוא מפסיק לנחש באופן כללי ומסוגל להבדיל בין אלמנטים צפופים על מסך או פרטים קטנים בגרף.

מתאים ל

  • אוטומציה של ממשקי משתמש

    זיהוי כפתורים ושדות במסכים בדיוק גבוה, שמאפשר לסוכנים ממוחשבים לנווט בתוכנות.

  • חילוץ נתונים מדוחות וגרפים

    קריאת ערכים מתרשימים ומסמכים בלי להעביר מידע רגיש לשרתים חיצוניים.

  • ספירה וסיווג מקומי בתמונות

    הפרדה בין עצמים דומים וספירה מדויקת על חומרה חלשה יחסית.

איפה זה נופל

זה עדיין דור קודם של הפרויקט, והיוצרים עצמם כבר הוציאו תצוגה מקדימה לגרסה שלוש. מעבר לכך, למרות ההתקדמות בטוקנייזר ופתרון באגים ביוניקוד, כרטיס המודל לא מדווח על תמיכה ישירה בעברית, ולכן טקסטים או מסמכים בעברית עלולים להישבר ב־OCR. במצב ההסקה המדויק יש פגיעה מורגשת במהירות התגובה, וחובה לנעול גרסה מסוימת בקוד כי המאגר מתעדכן בתדירות גבוהה ויכול לשבור תאימות.

שאלות
נפוצות

האם המודל יציב לשימוש ישיר בפרודקשן?

היוצרים ממליצים להגדיר revision ספציפי בקוד ולא למשוך את הגרסה האחרונה אוטומטית. המאגר מתעדכן לעיתים קרובות עם שינויים בארכיטקטורה ובטוקנייזר, וקיבוע גרסה ימנע הפתעות בריצה.

האם הוא מתאים לקריאת מסמכים בעברית?

הכרטיס מציג שיפורי OCR למסמכים באנגלית בלבד ואין אזכור לאימון על עברית. לפני שמסתמכים עליו לאיתור טקסט מקומי, חובה להריץ בדיקה ידנית על דוגמאות שלכם.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.6 גיגה-בייט בפורמט bfloat16, כך שהוא נכנס בקלות לכרטיס מסך ביתי בסיסי או למעבד רגיל דרך ספריית transformers. יש תמיכה בהידור מהיר שמשפר את הביצועים, והטוקנייזר המעודכן חותך עשרים עד ארבעים אחוז מזמן יצירת הטקסט.

אם אתם צריכים לפרוס אותו בענן לשאילתות ספורדיות בלבד, לפעמים עדיף לפנות ל־API חיצוני כדי לא להחזיק שרת דלוק. מנגד, אם יש לכם זרימת נתונים מקומית או שאתם בונים כלי שרץ על מחשב של משתמש, המשקל הנמוך שלו הופך אותו למועמד טבעי להרצה עצמאית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="vikhyatk/moondream2")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בלי תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗