GPT
D

DeepSeek-V4-Flash-Vision-Exp-GGUF

קוד פתוח

unslothmit2026-08-31

  • transformers
  • gguf
  • unsloth
  • deepseek
  • endpoints_compatible

גרסת GGUF ניסיונית למודל רב-מודאלי מבוסס MoE, שמיועדת למי שרוצה להריץ סוכן תוכנה מבוסס קוד ותמונות מקומית בלי לשתף מידע רגיש עם שירותי ענן.

  • 1.1 TBמשקל הקבצים
  • 18,392הורדות בחודש
  • 79לייקים

מה זה

מדובר במודל ניסיוני שמרחיב את ארכיטקטורת Flash של DeepSeek באמצעות מודול ראייה שעבר אימון המשך. הוא כולל תמיכה בתשתיות כמו DFlash attention וארכיטקטורת MoE. לפי המבחנים, הוא מתפקד בעיקר כסוכן: בבדיקות של סוכני קוד וטקסט כמו Terminal Bench 2.1 הוא מגיע לתוצאה של 83.9, וב־DeepSWE ל־59.3, תוצאות קרובות מאוד למודלים מסחריים סגורים כמו Opus-4.8 שמופיע בהשוואה עם 58.0.

התוספת המשמעותית כאן היא היכולת הרב-מודאלית. במבחן ApexBench לפתרון משימות עם תמונות הוא משיג 36.5 לעומת 26.2 של הגרסה הקודמת שהתעלמה מקלטי תמונה. המודל מתמודד גם עם ניתוח גרפים עם תוצאה של 64.3 ב־Chartography, כך שהוא מסוגל לקבל קבצי תמונה ישירות לצד פקודות טרמינל.

מתאים ל

  • סוכן טרמינל מקומי

    הרצת פקודות אוטומטיות בשרתים סגורים תודות לציון 83.9 ב־Terminal Bench.

  • ניתוח דיאגרמות וגרפים

    פענוח תרשימים טכניים בסביבות עבודה רגישות ללא תלות ברשת חיצונית.

  • איתור באגים מתוך צילומי מסך

    הצלבת פלט חזותי של שגיאות יחד עם קוד המקור בתוך סביבת הפיתוח.

איפה זה נופל

זהו מודל שמוגדר במפורש כניסיוני. במבחני אוטומציה מורכבים כמו AutomationBench הוא משיג רק 25.7, וב־NL2Repo הוא מקבל 57.7 לעומת 69.7 של Opus-4.8. המשמעות היא שבמשימות תכנות תשתיתיות הדורשות בניית מאגרים שלמים, הוא עדיין רחוק מהרמה של מודלי הדגל המסחריים, ורצוי לבדוק אותו ביסודיות לפני שמפקידים בידיו תהליכים אוטונומיים.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד או עמדת עבודה בודדת?

לא. גרסת הקוונטיזציה הקטנה ביותר המוזכרת שוקלת מעל 150GB. תצטרכו שרת ייעודי עם מספר כרטיסי מסך או נפח זיכרון עצום כדי לטעון אותו.

איזו גרסת תוכנה נדרשת כדי לעבוד עם תמונות?

קלט תמונה עובד רק החל מגרסת llama.cpp מספר b10766. גרסאות ישנות יותר פשוט לא יזהו את שכבות הראייה.

איך מריצים

להרצה מקומית תצטרכו שרת כבד מאוד. גרסת הדיוק המלא Q8 שוקלת 162GB, וגרסת Q4 קרובה אליה עם משקל של 155GB. זה אומר שאתם חייבים מערך כרטיסי מסך עם נפח VRAM משמעותי, או שרת ייעודי עם מספיק זיכרון מערכת, אחרת אין מה לנסות לטעון אותו.

בנוסף, קלט תמונה דורש גרסת llama.cpp עדכנית ממספר b10766 ומעלה שתומכת בראייה של הדגם הזה. אם אין לכם חומרה כזו בארגון, עדיף להשתמש ב־API מרוחק או ממשק ענן מוכן ולא להסתבך עם אחסון ותחזוקה של משקלים כאלה.

ollama run hf.co/unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF:IQ4_XS

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

42 קבצים במאגר, 1.1 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל והמאגר מופצים תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי חופשי לחלוטין, שינוי הקוד, הפצה ושילוב שלו בתוך מוצרים פרטיים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗