GPT
D

deepseek-vl-1.3b-chat

קוד פתוח

deepseek-aiother2024-03-07

  • transformers
  • safetensors
  • multi_modality
  • image-text-to-text
  • endpoints_compatible

מודל ראייה ושפה קטן במיוחד שנועד לרוץ מקומית בלי לבלוע משאבים. הוא מתאים למי שחייב לפענח תרשימים, נוסחאות וצילומי מסך בתוך סביבה מוגבלת בלי להוציא שקל על שירותי ענן.

  • 2Bפרמטרים
  • 3.7 GBמשקל הקבצים
  • 7,477הורדות בחודש
  • 73לייקים

מה זה

מדובר במודל שיחה מולטימודלי קומפקטי שמחבר בין מקודד התמונות SigLIP-L לבין מודל שפה של 1.3 מיליארד פרמטרים, כשהמערכת כולה תופסת בפועל קרוב לשני מיליארד פרמטרים. שלב האימון כלל בערך 500 מיליארד טוקנים של טקסט ועוד 400 מיליארד טוקנים משולבים של תמונה וטקסט, שזה נפח נאה מאוד למשקל כזה.

הוא מכוון ישירות לטיפול בתרשימים לוגיים, נוסחאות מדעיות, דפי אינטרנט ותמונות רגילות. בגלל הגודל שלו הוא לא יחליף מודלי ענק בניתוחים פילוסופיים מורכבים, אבל הוא כן נותן מענה מהיר ומקומי למי שצריך חילוץ מידע והבנה בסיסית מתוך מסמכים גרפיים ונתונים חזותיים.

מתאים ל

  • חילוץ תרשימים ודיאגרמות

    הוא אומן על הבנת תרשימים לוגיים ומתאים לעיבוד שרטוטים במערכות מקומיות.

  • קריאת נוסחאות מדעיות

    זיהוי משוואות וסמלים מתוך צילומים ודוחות טכניים ללא תלות ברשת.

  • בוט חזותי במכשירי קצה

    גודל של שני מיליארד פרמטרים מאפשר תגובה מהירה על חומרה חלשה יחסית.

איפה זה נופל

המגבלה הטכנית הבולטת ביותר היא רזולוציית התמונה, שנעצרת ב־384 על 384 פיקסלים בגלל מקודד הראייה. זה אומר שמסמכים צפופים מדי, טקסט זעיר או צילומי מסך עמוסי פרטים יאבדו חדות ויובילו לפספוסים בהבנה. בנוסף, בסיס השפה קטן יחסית, כך ששאלות עמוקות שדורשות ידע כללי רחב או הסקת מסקנות מפותלת עלולות להניב הזיות או תשובות שטחיות.

אותה משפחה

deepseek-vl יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בתמונות ברזולוציה גבוהה?

לא. מקודד התמונה שלו מקבל קלט בגודל 384 על 384 פיקסלים בלבד. תמונות גדולות יותר יעברו כיווץ, מה שעלול להקשות על קריאת פרטים קטנים וטקסט צפוף.

האם אפשר להשתמש בו במוצר מסחרי?

כן, כרטיס המודל מציין תמיכה בשימוש מסחרי עבור גרסת השיחה. עם זאת, השימוש כפוף לרישיון הדגמים של DeepSeek ולא לרישיון קוד פתוח סטנדרטי לחלוטין, ולכן מומלץ לקרוא את התנאים שלהם.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.7 גיגה בייט בפורמט float16, מה שאומר שאפשר להריץ אותו בקלות על כרטיס מסך ביתי צנוע עם 6 עד 8 גיגה זיכרון, ואפילו על מחשבים ניידים מודרניים. ההתקנה דורשת סביבת פייתון 3.8 ומעלה, שיבוט של המאגר מגיטהאב והתקנת התלויות דרך pip, לצד ספריית transformers.

המפתחים סיפקו סקריפט מוכן להרצה פשוטה בשורת הפקודה דרך cli_chat.py. אם אתם צריכים רק ניתוח מזדמן של כמה תמונות ביום בלי לדאוג לשרתים ולתחזוקה, עדיף להשתמש בפתרון ענן מוכן, אבל אם יש לכם זרימת עבודה מקומית או דרישות פרטיות, ההרצה העצמית כאן כמעט לא דורשת מאמץ תשתיתי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="deepseek-ai/deepseek-vl-1.3b-chat")
print(pipe("שלום"))

הרישיון

קוד המקור פתוח תחת רישיון MIT, אך משקלי המודל כפופים לרישיון ייעודי בשם DeepSeek Model License. החברה מצהירה במפורש שהשימוש המסחרי מותר הן לגרסת הבסיס והן לגרסת השיחה, אך יש לבדוק את מסמך הרישיון המלא שלהם לפני שילוב ישיר במוצר מסחרי כדי לוודא עמידה בכל התנאים המדויקים.

הרישיון המלא בעמוד המודל ↗