GPT
D

deepseek-vl2

קוד פתוח

deepseek-aiother2024-12-13

  • transformers
  • safetensors
  • deepseek_vl_v2
  • image-text-to-text
  • endpoints_compatible

מודל ראייה ושפה מבוסס תערובת מומחים שמפעיל 4.5 מיליארד פרמטרים בלבד בכל שלב. מתאים למי שרוצה ביצועים של מודל ענק בלי לשלם בזמן חישוב כבד על כל טוקן.

  • 27Bפרמטרים
  • 51.2 GBמשקל הקבצים
  • 5,955הורדות בחודש
  • 389לייקים

מה זה

מדובר בגרסה הגדולה בסדרת הראייה של deepseek-ai, הבנויה על בסיס DeepSeekMoE-27B. למרות שיש לו יותר מ־27 מיליארד פרמטרים בסך הכול, הארכיטקטורה מפעילה רק 4.5 מיליארד בכל פעולת הסקה. הרעיון כאן הוא לקבל הבנה עמוקה של תמונות ומסמכים בקצב ריצה של מודל קטן בהרבה.

הוא מיועד למשימות כמו חילוץ טקסט מתמונות, מענה על שאלות ויזואליות, פיענוח גרפים, טבלאות ואיתור אובייקטים במרחב התמונה. השילוב בין מומחים ייעודיים מאפשר לו להתמודד עם מסמכים צפופים בלי להיחנק, תוך שמירה על משאבי חישוב נמוכים בזמן הריצה.

מתאים ל

  • פיענוח מסמכים ותרשימים

    קריאת טבלאות וגרפים מורכבים ברזולוציה גבוהה כשמזינים עד שתי תמונות בכל פנייה.

  • זיהוי ומיקום אובייקטים

    איתור אלמנטים חזותיים במרחב התמונה ומתן נקודות ציון ויזואליות מדויקות.

  • תשאול תמונות יחידות

    מתן מענה מפורט לשאלות על גבי תמונה בודדת תוך ניצול מקסימלי של פרטי החיתוך הדינמי.

איפה זה נופל

הפשרה המרכזית כאן קשורה לריבוי תמונות. כשיש עד שתי תמונות המודל משתמש בחיתוך דינמי שמביא פירוט גבוה, אבל כשמעלים שלוש תמונות ומעלה הוא מצמצם ומרפד אותן לרזולוציה בסיסית של 384 על 384 פיקסלים בלי חיתוך, מה שמוביל לאיבוד פרטים קטנים במסמכים מורכבים. בנוסף, לא מצורף מידע על תמיכה בעברית בכרטיס המודל, כך שחילוץ טקסט מקומי דורש בדיקה מראש לפני שמשלבים אותו בזרימת עבודה.

שאלות
נפוצות

כמה זיכרון וידאו צריך בשביל להריץ אותו בפועל?

המשקלים לבדם תופסים 51.2 גיגה־בייט ב־bfloat16. להרצה יציבה עם תמונות וקלט ארוך תצטרכו כרטיס A100 או שני כרטיסים של 24 גיגה־בייט לפחות, אלא אם תבצעו כימות.

איך המודל מתמודד עם השוואה בין כמה מסמכים בו זמנית?

החל משלוש תמונות ומעלה המודל מכווץ את הקלט לגודל קבוע של 384 על 384 פיקסלים בלי חלוקה דינמית. אם המסמכים כוללים אותיות קטנות או טבלאות דחוסות, איכות הקריאה תיפגע משמעותית.

מה ההבדל בינו לבין גרסאות Tiny ו־Small?

ההבדל העיקרי הוא מודל השפה שבבסיס. הגרסה הזו נשענת על בסיס של 27 מיליארד פרמטרים ומפעילה 4.5 מיליארד בפועל, בעוד הגרסאות הקטנות מפעילות מיליארד או 2.8 מיליארד פרמטרים בהתאמה.

איך מריצים

כדי להריץ אותו צריך לפנות מקום ל־51.2 גיגה־בייט של קבצי משקלים בפורמט bfloat16, מה שמחייב כרטיס עם זיכרון וידאו של 48 גיגה־בייט לפחות, או שילוב של שני כרטיסי 24 גיגה־בייט. ההתקנה דורשת סביבת פייתון מגרסה 3.8 ומעלה והרצה מקומית דרך transformers עם התקנת המאגר מהמקור.

בזמן ההרצה המפתחים ממליצים להגביל את הטמפרטורה לעד 0.7 כדי לא לפגוע באיכות הפלט. אם אין לכם חומרה ייעודית מתאימה, כדאי לשקול את הגרסאות הקטנות יותר בסדרה, Tiny או Small, שמפעילות פחות פרמטרים ודורשות הרבה פחות זיכרון.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="deepseek-ai/deepseek-vl2")
print(pipe("שלום"))

הרישיון

הקוד עצמו משוחרר ברישיון MIT החופשי, אבל קבצי המודל כפופים לרישיון ייעודי בשם DeepSeek Model License המוגדר כ־other. המפתחים מציינים שהרישיון מאפשר שימוש מסחרי, אך חובה לקרוא את תנאי הרישיון המדויקים במאגר לפני שמפיצים אותו במוצר.

הרישיון המלא בעמוד המודל ↗