GPT
D

DeepSeek-OCR

קוד פתוח

deepseek-aimit2025-10-17

  • transformers
  • safetensors
  • deepseek_vl_v2
  • feature-extraction
  • deepseek

פתרון ראייה וטקסט שמחלץ תוכן מתמונות ומסמכים סרוקים ישירות לטקסט. הוא קטן מספיק להרצה מקומית בלי לרוקן את תקציב השרתים.

  • 3.3Bפרמטרים
  • 8,192טוקנים בהקשר
  • 6.2 GBמשקל הקבצים
  • 2,389,639הורדות בחודש

מה זה

מדובר במודל ייעודי לעיבוד תמונה לטקסט עם 3.3 מיליארד פרמטרים וארכיטקטורת DeepseekOCRForCausalLM, שמתרכז בדחיסה אופטית של מסמכים. במקום להשתמש במודל ענק כללי כדי לקרוא דפים סרוקים, המערכת הזו מכוונת ישירות לחילוץ תווים ומבנה מתוך קבצים ויזואליים.

הוא שוקל 6.2 גיגה בייט בדיוק bfloat16 ומחזיק חלון הקשר של 8,192 טוקנים על פני 12 שכבות. התמיכה היא רב לשונית, והכרטיס מציין חיבור לספריות קיימות בתחום המסמכים כמו GOT-OCR2.0 ו־PaddleOCR לצד בדיקות מול OmniDocBench, כך שהדגש כאן הוא קריאת ניירת, נוסחאות וגרפים ולא סתם תיאור כללי של תמונות נוף.

מתאים ל

  • סריקת קבצי PDF מקומית

    חילוץ טקסט מלא ממסמכים ישירות דרך vLLM בלי לשלוח מידע רגיש לשרתים חיצוניים.

  • קריאת גרפים וטבלאות

    המרה של דיאגרמות ותרשימים מורכבים לטקסט מובנה בזכות ארכיטקטורת דחיסה אופטית.

  • עיבוד תמונות במסלול Batch

    משקל של 6.2 גיגה בייט שמאפשר להריץ סריקות המוניות במקביל על כרטיס תצוגה סטנדרטי.

איפה זה נופל

הכרטיס לא מציג ציוני דיוק רשמיים, מה שמחייב אתכם לבדוק בעצמכם איך הוא מתמודד עם טקסטים מורכבים. למרות התיוג הרב לשוני, אין פירוט לגבי איכות הפענוח של כתב עברי, גופנים מקומיים או כיווניות מימין לשמאל.

בנוסף, חלון של 8,192 טוקנים מגביל את כמות הטקסט שאפשר לפלוט בריצה רציפה אחת. מסמכים ארוכים או סריקות מרובות עמודים ידרשו פירוק מקדים של הקובץ וניהול שרשור ידני כדי לא לחרוג מהמגבלה.

שאלות
נפוצות

איזה כרטיס מסך נחוץ כדי להריץ אותו בפועל?

המודל שוקל 6.2 גיגה בייט ב־bfloat16, ולכן כרטיס אנבידיה עם 12 גיגה זיכרון יספיק לעבודה בסיסית. לעבודה עם vLLM ומסמכים עמוסים עדיף כרטיס של 16 או 24 גיגה כדי לטפל בקלט בלי מחסור בזיכרון.

האם הוא יודע לקרוא עברית מסריקות?

המודל מוגדר כרב לשוני, אבל כרטיס המודל לא מפרט אילו שפות נבדקו בפועל. לפני שבונים עליו לניירת ישראלית, חובה להריץ בדיקה על מדגם מסמכים אמיתי עם עברית ולוודא שהוא לא הופך אותיות או מדלג על מילים.

האם אפשר להריץ אותו ישירות דרך Transformers?

כן, הקוד מותאם ישירות לספריית transformers בגרסה 4.46.3 על פייתון 3.12.9. תצטרכו להתקין גם חבילות נלוות כמו einops, addict, easydict ו־flash-attn כדי שההרצה תעבוד בצורה תקינה.

איך מריצים

המשקל דורש כרטיס גרפי של אנבידיה עם תמיכה ב־CUDA 11.8 וספריית flash-attn בגרסה 2.7.3. בגלל גודל של 6.2 גיגה בייט בפורמט bfloat16, כרטיס צרכני עם 12 או 16 גיגה בייט VRAM יחזיק אותו בקלות בריצה מקומית, במיוחד דרך תמיכת vLLM הרשמית שנוספה לפרויקט.

אם אתם צריכים להריץ דפים בודדים פעם בשעה, ההתעסקות עם תלויות פייתון ספציפיות כמו addict ו־easydict מיותרת. לעומת זאת, בעיבוד נפחים גדולים של PDF ומסמכים רגישים, הרצה עצמית על שרת ייעודי תהיה זולה ומהירה בהרבה משירותי ענן חיצוניים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="deepseek-ai/DeepSeek-OCR")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, להטמיע אותו במוצר סגור ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗