GPT
D

deepseek-vl2-small

קוד פתוח

deepseek-aiother2024-12-13

  • transformers
  • safetensors
  • deepseek_vl_v2
  • image-text-to-text
  • conversational

מודל ראייה ושפה שמבוסס על תצורת מומחים ומפעיל רק 2.8B פרמטרים בכל שלב. הוא נותן מענה מהיר למסמכים ותמונות בלי לסחוב משקל של מודל ענק.

  • 16Bפרמטרים
  • 30.1 GBמשקל הקבצים
  • 6,958הורדות בחודש
  • 180לייקים

מה זה

מדובר בגרסת הביניים של סדרת הראייה השנייה מבית deepseek-ai, הבנויה על בסיס DeepSeekMoE-16B. למרות שיש לו 16,148,349,504 פרמטרים בסך הכול, רק 2.8B מהם פעילים בכל עיבוד. השיטה הזו מאפשרת לו לנתח שאלות על תמונות, לבצע OCR, להבין טבלאות ולמקם אלמנטים גרפיים בקצב ריצה מהיר בהרבה ממודלים צפופים בגודל דומה.

בסדרה הזו קיימות שלוש גרסאות שההבדל ביניהן הוא מודל השפה שבבסיס. הגרסה הקטנה יותר מפעילה 1.0B פרמטרים והגדולה מפעילה 4.5B. הגרסה הזו יושבת בדיוק באמצע, ומציעה איזון למי שרוצה יכולות עיבוד של מודל רחב בלי לשלם על כך בזמני השהיה ארוכים.

מתאים ל

  • חילוץ נתונים מטבלאות ודוחות

    הוא מיועד להבנת מסמכים וטבלאות ברמת דיוק גבוהה, כל עוד מדובר במסמך של עד שתי תמונות ברזולוציה מלאה.

  • זיהוי טקסט ותוכן בתמונה

    יכולות ה־OCR והתשובות הוויזואליות שלו נשענות על 2.8B פרמטרים מופעלים בלבד, מה שמייצר תגובה מהירה.

  • איתור אלמנטים גרפיים

    מתאים למשימות visual grounding שמחייבות קישור ישיר בין טקסט למיקום של עצמים בתוך התמונה.

איפה זה נופל

אם מזינים שלוש תמונות ומעלה, מנגנון החלוקה הדינמי מתבטל והמודל פשוט מצמצם ומרפד את כל התמונות לגודל של 384 על 384 פיקסלים. זה פוגע ביכולת לקרוא טקסט קטן או פרטים עדינים במסמכים מרובי עמודים. בנוסף, כל חריגה מטמפרטורה של 0.7 מורידה את איכות הפלט לפי דיווחי המפתחים, כך שאין כאן מרחב תמרון ליצירתיות.

שאלות
נפוצות

איך המודל מתמודד עם ניתוח של כמה תמונות יחד?

עבור תמונה אחת או שתיים הוא משתמש בפריסה דינמית ששומרת על הפרטים. החל משלוש תמונות ומעלה הוא דוחס ומרפד אותן לגודל קבוע של 384 על 384, מה שעלול להקשות על קריאת טקסט קטן.

האם אפשר להריץ אותו על מחשב אישי רגיל?

הקבצים שוקלים 30.1 GB בדיוק bfloat16, ולכן חייבים כרטיס גרפי עם מספיק זיכרון ייעודי כדי להטעין את כולם יחד, על אף שבזמן הריצה מופעלים רק 2.8B פרמטרים.

איך מריצים

כדי להריץ אותו מקומית צריך לפרוק 30.1 GB של קובצי משקל ברמת דיוק bfloat16, ולהשתמש בסביבת Python מגרסה 3.8 ומעלה עם ספריית transformers. הזיכרון הגרפי צריך להכיל את מלוא המשקל של המודל, למרות שבפועל מופעלים רק חלק מהפרמטרים בכל רגע נתון.

המפתחים ממליצים לדגום בטמפרטורה של עד 0.7 כדי לא לפגוע באיכות התוצרים. אם אין ברשותכם כרטיס גרפי מתאים שיכול להחזיק קבצים בנפח כזה, עדיף להשתמש בפתרון מרוחק במקום להשקיע בברזלים ייעודיים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="deepseek-ai/deepseek-vl2-small")
print(pipe("שלום"))

הרישיון

הקוד בריפו מופץ תחת רישיון MIT, אך משקלי המודל כפופים לרישיון ייעודי בשם DeepSeek Model License שמסווג כרגע בתור other. המפתחים מציינים במפורש שהסדרה תומכת בשימוש מסחרי, אך חובה לקרוא את תנאי הרישיון המדויקים שלהם לפני שילוב שלו במוצר.

הרישיון המלא בעמוד המודל ↗