GPT
D

deepseek-vl2-tiny

קוד פתוח

deepseek-aiother2024-12-13

  • transformers
  • safetensors
  • deepseek_vl_v2
  • image-text-to-text
  • endpoints_compatible

מודל ראייה ושפה קומפקטי שמפעיל רק מיליארד פרמטרים בכל רגע נתון. הוא נותן פתרון מהיר לקריאת מסמכים וטבלאות על חומרה צנועה יחסית.

  • 3.4Bפרמטרים
  • 6.3 GBמשקל הקבצים
  • 102,049הורדות בחודש
  • 249לייקים

מה זה

מדובר בגרסה הקטנה ביותר בסדרת הראייה והשפה של דיפסיק, שמבוססת על ארכיטקטורת תערובת מומחים. למרות שבסך הכל יש לו 3.4 מיליארד פרמטרים שיושבים בזיכרון, בכל עיבוד הוא מפעיל רק מיליארד פרמטרים בודד. הרעיון כאן הוא לקבל מהירות ריצה של מודל קטנטן בלי לוותר על הידע שנצבר ברשת גדולה יותר.

הוא מיועד למשימות מגוונות של עיבוד תמונה וטקסט יחד. זה כולל מענה לשאלות על גבי תמונות, חילוץ טקסט מתמונות, ניתוח של דיאגרמות ותרשימים, ואיתור מיקומים מדויקים של אובייקטים בתוך הפריים. ההבדל בינו לבין הגרסאות הגדולות יותר בסדרה מתמצה במודל השפה שבבסיסו, כך שכאן מקבלים את החלופה הקלה ביותר ליישום נקודתי.

מתאים ל

  • חילוץ נתונים מטבלאות

    מפענח טבלאות ותרשימים מתמונות במהירות ובמשאבי זיכרון נמוכים, בלי להעמיס על השרת.

  • זיהוי טקסט מקומי

    מתאים לצימוד לתוך תהליכי OCR פנימיים שבהם המידע חייב להישאר על החומרה המקומית שלכם.

  • איתור אובייקטים בתמונה

    מספק יכולת visual grounding מדויקת לזיהוי מיקום של פריטים ספציפיים לפי הנחיה טקסטואלית.

איפה זה נופל

היוצרים מדגישים שטמפרטורת הדגימה חייבת להישאר מתחת ל־0.7, כי כל ערך גבוה מזה מוריד ישירות את איכות התשובות. בנוסף, יש מגבלה ברורה על ריבוי תמונות. בעד שתי תמונות המודל משתמש בחלוקה חכמה לרשת של אריחים כדי לשמור על רזולוציה, אבל משלוש תמונות ומעלה הוא מכווץ וממלא אותן לגודל קבוע של 384 על 384 פיקסלים, מה שפוגע בפרטים הקטנים. מעבר לזה, עם מודל שפה של מיליארד פרמטרים פעילים, אל תצפו ממנו לניתוח טקסטואלי עמוק או לניסוחים מורכבים.

שאלות
נפוצות

איך המודל מתמודד עם עיבוד של כמה תמונות יחד?

הוא מיישם שיטה דינמית של חלוקה לאריחים רק עבור תמונה אחת או שתיים. אם תעבירו לו שלוש תמונות או יותר, הוא ישטח וירפד אותן לרזולוציה בסיסית של 384 על 384, מה שיגרור איבוד פרטים מהותי.

האם כדאי להעלות את הטמפרטורה כדי לקבל תשובות יצירתיות?

לא. המפתחים מזהירים במפורש ששימוש בטמפרטורה מעל 0.7 פוגע באופן ישיר באיכות הפלט של המודל, ולכן מומלץ להישאר מתחת לערך הזה.

איך מריצים

כדי להריץ אותו צריך סביבת פייתון 3.8 ומעלה וספריית טרנספורמרס. המשקלים שוקלים 6.3 גיגה בייט בדיוק של bfloat16, מה שאומר שאפשר להריץ אותו בנוחות על כרטיס מסך בודד עם 8 עד 12 גיגה זיכרון, בלי להסתבך עם קלאסטרים יקרים.

מי שצריך לפענח כמויות קטנות מאוד של תמונות פעם בכמה זמן כנראה יעדיף לקרוא ל־API חיצוני ולא לתחזק שרת. לעומת זאת, אם יש לכם זרימת עבודה רציפה של מסמכים ורצון לשמור על פרטיות הנתונים אצלכם, המשקל הנמוך של הקבצים מאפשר פריסה עצמאית וזולה מאוד על חומרה מקומית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="deepseek-ai/deepseek-vl2-tiny")
print(pipe("שלום"))

הרישיון

הקוד בריפו מוגדר תחת רישיון MIT, אך משקלי המודל עצמם כפופים לרישיון ייעודי של דיפסיק. הכרטיס מציין במפורש שהסדרה תומכת בשימוש מסחרי, אבל בגלל שהרישיון סווג כמותאם אישית, חובה לקרוא את קובץ הרישיון המלא של המודל כדי לוודא שאין בו מגבלות הפצה או דרישות דיווח ספציפיות לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗