GPT
D

DeepSeek-OCR-2

קוד פתוח

deepseek-aiapache-2.02026-01-27

  • transformers
  • safetensors
  • deepseek_vl_v2
  • feature-extraction
  • deepseek

מודל ראייה ושפה קומפקטי שמחלץ טקסט מתמונות ומסמכים ישירות למרקדאון. הוא מביא ארכיטקטורת זיהוי מתקדמת במשקל נמוך שרץ מקומית בלי לחנוק את החומרה.

  • 3.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 6.3 GBמשקל הקבצים
  • 962,861הורדות בחודש

מה זה

מדובר במודל ייעודי להמרת מסמכים ותמונות לטקסט, שפותח כדי לטפל גם במבנה הדף ולא רק במילים בודדות. עם 3.4 מיליארד פרמטרים, הוא מתרכז במשימות קריאת מסמכים מלאים, המרה למרקדאון עם שימור מבנה, או חילוץ טקסט חופשי לפי פקודה. הוא תומך ברזולוציה דינמית שמחלקת מסמכים מורכבים לחלקים ומייצרת טוקנים ויזואליים בהתאם לצורך.

במקום לקחת מודל ענק וכללי לניתוח תמונות, כאן יש כלי שמוטב ישירות לעיבוד מסמכים. הוא מוגדר רב לשוני, אבל כדאי לבדוק אותו מראש על מסמכים מקומיים מורכבים. למרות שיש לו רק 12 שכבות, הארכיטקטורה מכוונת לספק דיוק גבוה במבנה המסמך תוך צריכת משאבים סבירה.

מתאים ל

  • המרת סריקות למרקדאון

    חילוץ מסמכים סרוקים ישירות לקובצי טקסט עם כותרות ומבנה בעזרת הפרומפט המובנה.

  • חילוץ טקסט חופשי מתמונות

    קריאת תוכן מתוך צילומי מסך ותמונות כלליות ללא תלות במבנה הדף המקורי.

  • צינור עיבוד מסמכים פנימי

    הרצה מקומית בשרת שלכם לארגונים שלא רוצים להוציא קובצי מסמכים רגישים החוצה.

איפה זה נופל

המודל דורש הפעלת trust remote code בטעינה, מה שמחייב בדיקת אבטחה של הקוד לפני שמריצים אותו בסביבה ארגונית. הוא מוגבל לחלון הקשר של 8,192 טוקנים, כך שמסמכים עמוסים מאוד או מרובי עמודים ידרשו חיתוך וטיפול מקדים. בנוסף, הכרטיס לא מציג ציוני ביצועים ספציפיים לשפות שאינן אנגלית, ולכן חייבים לבדוק עצמאית איך הוא מתמודד עם טקסט בעברית ויישור מימין לשמאל.

שאלות
נפוצות

האם המודל עובד טוב על מסמכים בעברית?

הוא מוגדר רב לשוני, אבל המפתחים לא פרסמו תוצאות מדידה ייעודיות לעברית. תצטרכו להריץ עליו מדגם של מסמכים שלכם כדי לבדוק איך הוא מתמודד עם גופנים מקומיים וכיווניות ימין לשמאל.

איזה כרטיס מסך מינימלי צריך כדי להריץ אותו?

המשקל שלו הוא כ־6.3 גיגה בייט בזיכרון, ולכן כרטיס מודרני עם 12 עד 16 גיגה זיכרון וידאו ותמיכה ב־Flash Attention יספיק לרוב התמונות. עבור עיבוד מסמכים גדולים במיוחד ברזולוציה מלאה, עדיף להצטייד בכרטיס עם 24 גיגה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של אנבידיה עם תמיכה ב־CUDA ורצוי לפחות 16 גיגה זיכרון וידאו בשביל להחזיק את משקל המודל בפורמט bfloat16 יחד עם תמונות ברזולוציה גבוהה. ההרצה דורשת פייתון 3.12, חבילות כמו transformers ו־flash-attn, והפעלת קוד מרוחק בהגדרות הטעינה.

אם יש לכם כרטיס מתאים בשרת, ההרצה המקומית הגיונית לגמרי בגלל הגודל הצנוע שלו. מצד שני, אם אתם צריכים לפרק אלפי מסמכים במקביל בלי להחזיק תשתית ייעודית מתוחזקת, שירות מנוהל חיצוני יהיה פשוט יותר לתפעול.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="deepseek-ai/DeepSeek-OCR-2")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון אפאצ'י 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצר, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗