GPT
M

moondream3-preview

קוד פתוח

moondreamother2025-09-11

  • transformers
  • safetensors
  • moondream3
  • text-generation
  • image-text-to-text

מודל ראייה ושפה קטן יחסית שמפעיל רק שני מיליארד פרמטרים בכל רגע מתוך תשעה. הוא מתאים למי שמחפש יכולות זיהוי, ספירה והסבר תמונות בלי להחזיק מפלצת כבדה בשרת.

  • 9.3Bפרמטרים
  • 44.3 GBמשקל הקבצים
  • 131,881הורדות בחודש
  • 683לייקים

מה זה

מדובר במודל ראייה ושפה שמבוסס על ארכיטקטורת תערובת מומחים. מתוך 9.3 מיליארד פרמטרים בסך הכול, רק שני מיליארד פעילים בכל טוקן, מה שמאפשר לו לחשב מהר בהרבה ממודל צפוף בגודל מלא. הוא משלב מקודד תמונה מסוג סיגליפ עם עיבוד חיתוכים מרובים ברזולוציה גבוהה, וכולל טוקנייזר ייעודי יחד עם חלון הקשר של עד 32 אלף טוקנים.

המודל מציע ארבע יכולות מובנות בקוד שלו. הוא יודע לענות על שאלות פתוחות בתמונות כולל מצב חשיבה מעמיק, לתאר תמונות באורכים שונים, להחזיר נקודות ציון מדויקות של אובייקטים לפי טקסט חופשי, ולייצר תיבות תוחמות סביב פריטים. מעבר לראייה, הוא מתפקד גם כמודל טקסט רגיל לחלוטין כשלא שולחים לו קובץ תמונה.

מתאים ל

  • זיהוי ומיקום עצמים בתמונה

    שליפת קואורדינטות ותיבות תוחמות ישירות מקוד פייתון בלי מודל זיהוי עצמים נפרד.

  • תיוג אוטומטי של קטלוג

    יצירת תיאורים באורכים שונים מתוך תמונות מוצר במהירות בזכות ארכיטקטורת המומחים.

  • מענה מרובה על תמונה אחת

    קידוד התמונה פעם אחת בזיכרון ותשאול רציף של שאלות שונות בלי לעבד אותה מחדש.

איפה זה נופל

זהו שחרור מוקדם שמוגדר כתצוגה מקדימה, כך שייתכנו חוסר יציבות ושינויים. במצב מענה לשאלות, מנגנון החשיבה דולק כברירת מחדל ומוסיף זמן עיבוד מיותר אם השאלה פשוטה, כך שחייבים לכבות אותו ידנית בקוד כדי לחסוך משאבים. בנוסף, חובה לבדוק היטב את הדיוק של זיהוי הנקודות והתיבות בתמונות מורכבות לפני שסומכים עליהם באוטומציה.

שאלות
נפוצות

כמה זיכרון וידאו צריך כדי להריץ את המודל לוקאלית?

המשקולות לבדן שוקלות מעל 44 גיגה בייט בדיוק ביפלוט16. צריך מעבד גרפי מקצועי עם נפח זיכרון גדול מספיק להחזקת כל הפרמטרים, או להמתין לגרסאות מכווצות אם יפורסמו כאלה.

האם המודל דורש תמונה בכל פנייה?

לא. אפשר להשתמש במתודת השאילתה שלו עם טקסט בלבד, והוא יענה כמודל שפה רגיל לכל דבר ועניין.

איך מריצים

טעינת המודל מתבצעת דרך ספריית טרנספורמרס עם הרצת קוד מרוחק ודיוק ביפלוט16. החלק הקריטי הוא קריאה לפונקציית הקומפייל של המודל, שמשתמשת בפלקס אטנשן ומבצעת חימום כדי לקבל זמני תגובה מהירים. אם אתם שואלים כמה שאלות על אותו קובץ, כדאי לקודד את התמונה פעם אחת ולשלוח את הייצוג המוכן לכל שאילתה.

מבחינת חומרה, קבצי המשקולות תופסים מעל 44 גיגה בייט ומחולקים ל־29 חלקים, כך שתצטרכו כרטיס מסך חזק עם זיכרון וידאו משמעותי רק כדי לטעון אותם לזיכרון. למי שרוצה לבדוק התכנות מהירה בלי להשקיע בשרת יקר, החברה מציעה גם ממשק ענן עם מסלול חינמי להתחלה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="moondream/moondream3-preview")
print(pipe("שלום"))

הרישיון

הרישיון הוא ביזנס סורס 1.1 עם הגבלות שימוש של חברת אם87 לאבס. מותר להשתמש בו לצרכים פנימיים בחברה, במחקר, בפרויקטים אישיים ובמוצרים לצרכני קצה כמו תיוג תמונות באפליקציה. אסור למכור שירותי אירוח של המודל, ממשקי ראייה ממוחשבת לחברות אחרות, או ערכות פיתוח מתחרות בלי הסכם מסחרי נפרד.

הרישיון המלא בעמוד המודל ↗