GPT
D

unsloth/DeepSeek-OCR

קוד פתוח

unslothmit2025-10-27

  • safetensors
  • deepseek_vl_v2
  • deepseek
  • unsloth
  • vision-language

גרסה מותאמת של מודל הראייה והטקסט מבית דיפסיק, שמיועדת לחילוץ טקסט מתמונות ומסמכים. אנזלות׳ ערכו את המשקלים כדי לאפשר הרצה ואימון ישירות מעל ספריית טרנספורמרס העדכנית.

  • 3.3Bפרמטרים
  • 8,192טוקנים בהקשר
  • 6.2 GBמשקל הקבצים
  • 1,183הורדות בחודש

מה זה

מדובר במודל ראייה שמתמקד בזיהוי ודחיסה אופטית של טקסט מתוך תמונות ומסמכים, עם כ־3.3 מיליארד פרמטרים. הארכיטקטורה שלו מבוססת על 12 שכבות וחלון הקשר של 8,192 טוקנים, מה שמתאים לטיפול בעמודים עמוסים או מסמכים מורכבים.

הגרסה הזו של אנזלות׳ לקחה את המשקלים המקוריים של דיפסיק וערכה אותם כדי לתמוך בספריות טרנספורמרס חדשות בלי לפגוע בדיוק. בנוסף לתמיכה הרגילה, קיימת אפשרות להריץ אותו דרך גרסאות הפיתוח של vLLM לטובת שרשור בקשות מהיר ועיבוד קבצי PDF. המודל מוגדר כרב לשוני ונשען על רעיונות מפרויקטים כמו GOT-OCR2.0 ו־MinerU.

מתאים ל

  • חילוץ טקסט מקבצי PDF

    מתאים להמרת סריקות ומסמכים מרובי מלל לטקסט נקי, עם תמיכה מובנית בעיבוד מסמכים דרך vLLM.

  • אימון ייעודי על דאטה פנימי

    הגרסה של אנזלות׳ מותאמת ישירות ל־Fine-tuning זול ומהיר בספריות מודרניות ובמחברות קולאב.

  • זיהוי נתונים מתמונות ותרשימים

    הארכיטקטורה נשענת על מודלים לניתוח טבלאות ותרשימים לחילוץ מידע ויזואלי מורכב.

איפה זה נופל

למרות ההגדרה כרב לשוני, כרטיס המודל לא מציג ציוני דיוק ספציפיים בעברית או תמיכה בטקסט מימין לשמאל, ולכן חובה לבדוק אותו על מסמכים מקומיים לפני שסומכים עליו. התקנת הסביבה דורשת גרסאות תוכנה קשיחות מאוד, כולל flash-attn והתקנות nightly של vLLM, מה שעלול לייצר תקלות בסביבות פרודקשן קיימות.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ את המודל?

המודל תופס קצת מעל 6 גיגה בייט בזיכרון, כך שכרטיס מסך של אנבידיה עם 12 גיגה בייט VRAM יחזיק אותו בקלות יחד עם ההקשר של התמונה. כרטיסים צנועים יותר של 8 גיגה בייט עשויים לעבוד, אך יהיו גבוליים בעומס גבוה.

האם המודל תומך בעברית בצורה טובה?

הכרטיס מגדיר את המודל כרב לשוני, אך לא מציג מבחני ביצועים ספציפיים בעברית או התייחסות לטקסט מימין לשמאל. מומלץ להריץ בדיקה מקומית על דוגמאות של מסמכים וחשבוניות בעברית לפני שמחליטים להטמיע אותו.

איך מריצים

המודל שוקל 6.2 גיגה בייט בפורמט bfloat16 ומחולק לעשרים קבצים, כך שכרטיס מסך ביתי מודרני עם 8 עד 12 גיגה בייט זיכרון יספיק בהחלט להרצה מקומית. הסביבה דורשת פייתון 3.12.9, CUDA 11.8, חבילות כמו torch 2.6.0 ו־flash-attn בגרסה ייעודית, או שימוש בהתקנת הלילה של vLLM.

אם אתם צריכים רק לעבד כמה מסמכים ביום בלי לנהל תלויות של קודה וגרסאות ספציפיות של ספריות, הקמה מקומית תדרוש מכם התעסקות מיותרת. במקרים של נפח עבודה נמוך, פנייה לשירות ענן מוכן תחסוך את כאב הראש הטכני.

pip install -U huggingface_hub
hf download unsloth/DeepSeek-OCR

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, ושילוב במוצרים פנימיים או חיצוניים, בלי צורך לחשוף את הקוד שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗