GPT
D

DeepSeek-V4-Flash-Vision-Exp

קוד פתוח

deepseek-aimit2026-08-31

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • image-text-to-text

גרסה ניסיונית שמשלבת יכולות ראייה בתוך ארכיטקטורת סוכן טקסטואלי חזקה. מי שצריך לנתח מסכים, תרשימים וקוד בחלון הקשר עצום של מיליון טוקנים ימצא כאן מענה ישיר.

  • 305Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 156 GBמשקל הקבצים
  • 313,547הורדות בחודש

מה זה

מדובר במודל מולטימודלי ראשון במשפחת V4 Flash שמקבל תמונות וטקסט ומחזיר טקסט. המפתחים לקחו את הבסיס הטקסטואלי והוסיפו לו רכיבי עיבוד תמונה ויישור ויזואלי בלי לפגוע בביצועים הקיימים. הוא מתמודד ישירות עם משימות סוכן שדורשות הפעלת כלים, ניתוח קוד והבנת תמונות במקביל.

במבחני ביצועים רואים תמונה מעניינת מול גרסת הטקסט הקודמת ומול מודלים מובילים. במשימות ראייה ומולטימודל כמו ניתוח תרשימים הוא מזנק ומשיג 64.3 נקודות ב־Chartography, ומשפר את התוצאות במבחני סוכנים כמו ApexBench ל־36.5 נקודות. עם זאת, במשימות טקסט טהורות כמו הנדסת תוכנה או מסוף הוא שומר על רמה דומה מאוד לגרסה הקודמת ולא מציג קפיצה דרמטית.

מתאים ל

  • ניתוח תרשימים ודוחות

    מפענח גרפים ותרשימים טכניים ומחזיר מסקנות או קוד מדויק מתוכם לפי תוצאת 64.3 במדד הייעודי.

  • סוכן בדיקות ממשק משתמש

    קורא צילומי מסך במקביל לקוד ומפעיל כלים לפתרון תקלות בזכות שילוב יכולות טקסט ומולטימודל.

  • מחקר מסמכים ארוכים עם מדיה

    מעבד כמות אדירה של דפים ותמונות יחד בזכות תמיכה בחלון של מיליון טוקנים בהקשר אחד.

איפה זה נופל

זהו מודל מוגדר כניסיוני, והתוצאות מראות בדיוק איפה הוא מתקשה. בבדיקות אוטומציה מורכבות כמו AutomationBench הוא מגיע ל־25.7 בלבד, ובמבחן Agents Last Exam הוא עומד על 27.3. בנוסף, בביצועי סייבר ב־Cybergym נרשמה דווקא ירידה קלה מ־76.7 ל־75.3 לעומת גרסת הטקסט הקודמת. במשימות כתיבת ריפוזיטורי שלם הוא עדיין מפגר משמעותית מאחורי מודלים קנייניים כבדים.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת של כרטיס GPU בודד?

לא. המודל שוקל 156 גיגהבייט ודורש תשתית של לפחות ארבעה מאיצים ייעודיים ברמת שרתים עם מקביליות כדי לעלות לזיכרון ולעבוד בקצב סביר.

במה הוא עדיף על גרסת הפלאש הקודמת 0731?

הגרסה הזו יודעת לקבל תמונות ולהבין אותן, בעוד הגרסה הקודמת התעלמה לחלוטין מרכיבי ראייה ורצה על טקסט בלבד.

איך מריצים

כדי להריץ אותו מקומית צריך מערך חומרה כבד מאוד. הדוגמה הרשמית מציגה הרצה על גבי שרת יחיד עם ארבעה כרטיסי GB300 באמצעות vLLM או SGLang, תוך שימוש במקביליות טנזורים של 4 ודחיסת זיכרון מטמון ל־fp8. הקבצים שוקלים 156 גיגהבייט ודורשים רוחב פס רציני רק בשביל ההורדה והטעינה.

אם אין לכם שרת ייעודי כזה בענן, עדיף לפנות לממשק API מנוהל. התקנה עצמאית דורשת תמיכה במנגנון DSpark להאצה ספקולטיבית ובארכיטקטורת MoE של V4, כך שהרצה על חומרה ביתית או כרטיס בודד פשוט לא באה בחשבון.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="deepseek-ai/DeepSeek-V4-Flash-Vision-Exp")
print(pipe("שלום"))

הקבצים

84 קבצים במאגר, 156 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT מלא ופתוח לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, לשלב אותו במוצר סגור ולהפיץ אותו הלאה, בלי תמלוגים או הגבלות שימוש מיוחדות, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗