GPT
D

deepseek-vl-7b-chat

קוד פתוח

deepseek-aiother2024-03-07

  • transformers
  • safetensors
  • multi_modality
  • image-text-to-text
  • endpoints_compatible

מודל שיחה רב מודלי במשקל 7.3 מיליארד פרמטרים שמעבד תמונות וטקסט יחד. הוא נבנה כדי להבין תרשימים לוגיים, נוסחאות מתמטיות וצילומי מסך של אתרים בלי לשלוח מידע החוצה.

  • 7.3Bפרמטרים
  • 13.7 GBמשקל הקבצים
  • 8,563הורדות בחודש
  • 272לייקים

מה זה

הארכיטקטורה כאן מחברת בסיס שפה של שבעה מיליארד פרמטרים שאומן על כשני טריליון טוקנים, יחד עם אנקודר ראייה היברידי שמשלב את SigLIP ורכיב של SAM. החיבור הזה מאפשר קלט תמונה ברזולוציה של 1024 על 1024 פיקסלים, מה שעוזר לו להבחין בפרטים קטנים במסמכים מדעיים או דפי אינטרנט. שלב האימון הרב מודלי כלל כארבע מאות מיליארד טוקנים של ראייה ושפה.

גרסת הצ'אט הזו עברה כוונון מבוסס הוראות, ולכן היא עונה ישירות לשאלות על קבצים חזותיים מורכבים במקום רק להשלים טקסט. המיקוד הוא ניתוח תרשימים, פענוח נוסחאות והבנה של סביבות ויזואליות מורכבות, ולא סתם זיהוי אובייקטים בסיסי בצילומים רגילים.

מתאים ל

  • חילוץ מידע מנוסחאות

    הוא אומן על ספרות מדעית ויודע לקרוא נוסחאות ותרשימים לוגיים בדיוק גבוה.

  • פענוח ממשקי משתמש

    תמיכה בתמונות של 1024 על 1024 מאפשרת להזין צילומי מסך של אתרים ולנתח את המבנה שלהם.

  • בוט חזותי מקומי

    גרסת צ'אט שמתאימה לשיחה מבוססת תמונות על שרת פנימי בלי לחשוף נתונים לשרתים חיצוניים.

איפה זה נופל

המודל מוגבל לרזולוציית קלט של 1024 על 1024 פיקסלים, כך שתמונות גדולות או מסמכים עמוסים עלולים לאבד חדות בעיבוד. מעבר לזה, הכרטיס לא מציג ציוני בנצ'מרק ישירים מול מודלים מתחרים, ואין נתונים על יכולות העיבוד שלו בשפות שאינן אנגלית או סינית. אם אתם בונים על פענוח מסמכים בעברית, חובה להריץ בדיקות קונקרטיות לפני שמשלבים אותו בזרימת העבודה.

אותה משפחה

deepseek-vl יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי?

כן, לפי תיעוד המפתחים שתי הגרסאות תומכות בשימוש מסחרי. עם זאת, השימוש כפוף לתנאי רישיון המודל הייעודי של DeepSeek ולא ברישיון קוד פתוח סטנדרטי, ולכן מומלץ לעבור על תנאי ההסכם המקוריים.

איזו חומרה מינימלית נדרשת להרצה?

הקבצים שוקלים 13.7 גיגה בייט בפורמט float16. כדי להריץ הסקה תצטרכו כרטיס מסך עם לפחות 16 גיגה בייט של זיכרון גרפי, כאשר 24 גיגה יספקו מרווח עבודה נוח ובטוח יותר לתמונות כבדות.

איך מריצים

המשקל בנקודה צפה של 16 ביט עומד על 13.7 גיגה בייט, כך שצריך כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי לטעון אותו ולהריץ הסקה בצורה חלקה. ההרצה דורשת סביבת פייתון 3.8 ומעלה והתקנה ישירה של המאגר מגיטהאב דרך pip, יחד עם שימוש בספריית transformers.

מי שאין לו כרטיס תואם בענן המקומי או במחשב הפיתוח יצטרך לפנות לפתרונות מנוהלים. מצד שני, אם אתם צריכים לנתח מסמכים רגישים או שרטוטים הנדסיים שלא יכולים לצאת לשרת חיצוני, שווה להחזיק שרת ייעודי עבורו.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="deepseek-ai/deepseek-vl-7b-chat")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון MIT, אך משקולות המודל כפופות לרישיון הדגם של DeepSeek. הרישיון המדווח מוגדר כאחר, אך היוצרים מציינים במפורש שהדגם מאושר לשימוש מסחרי. כדאי לקרוא את נוסח ההסכם שלהם כדי לוודא שאין הגבלות שימוש ספציפיות על המוצר שאתם מפתחים.

הרישיון המלא בעמוד המודל ↗