GPT
D

unsloth/DeepSeek-OCR-2

קוד פתוח

unslothapache-2.02026-01-27

  • transformers
  • safetensors
  • deepseek_vl_v2
  • feature-extraction
  • deepseek

גרסה מותאמת של מודל ראייה וטקסט שחולץ מסמכים ישירות למרקדאון. הוא שוקל 3.4 מיליארד פרמטרים ומתאים למי שרוצה OCR מתקדם מקומית בלי לפתח הכל מאפס.

  • 3.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 6.3 GBמשקל הקבצים
  • 5,649הורדות בחודש

מה זה

מדובר בהתאמה של Unsloth למודל הראייה DeepSeek-OCR-2, ששונתה כדי לתמוך בסביבות עבודה עדכניות של transformers בלי לפגוע ברמת הדיוק. המשימה המרכזית שלו היא המרת תמונות של מסמכים לטקסט מובנה, פירוק גרפים וטבלאות, ואפילו תיאור תמונות כללי. בניגוד לכלים מסורתיים שרק מוציאים מחרוזות מילים, הוא מזהה עימוד ומייצא מרקדאון נקי.

הוא מבוסס על ארכיטקטורת DeepseekOCR2 ומכיל 12 שכבות בדיוק bfloat16. חלון ההקשר עומד על 8,192 טוקנים, מה שמאפשר להזין לו תמונות ברזולוציה דינמית תוך פירוק המסמך לטוקנים ויזואליים מרובים, בלי לחתוך חלקים מהדף באמצע.

מתאים ל

  • המרת מסמכים סרוקים

    חילוץ טקסט מדוחות, טפסים ומאמרים ישירות למבנה מרקדאון ששומר על פסקאות ורשימות.

  • פיענוח גרפים ותרשימים

    הבנת נתונים חזותיים מתוך איורים בתמונות ותרגומם למלל מוסבר היטב.

  • איתור אלמנטים לפי מיקום

    שליפת נתונים נקודתיים מתוך תמונה באמצעות תיוג והפניה לפי מיקום ויזואלי.

איפה זה נופל

המודל מחייב שימוש ב־flash-attn ודרישות גרסה קשיחות של פייתון וחבילות מסוימות, מה שהופך את ההתקנה הראשונית לרגישה לתקלות. כמו כן, למרות שהוא מוגדר כמולטי-לנגואל, הכרטיס לא מציין מדדים ספציפיים לגבי רמת הדיוק שלו בעברית, ולכן חובה לבדוק מסמכים מקומיים לפני שסומכים עליו בעיבוד אוטומטי.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

המודל מתויג כתומך בריבוי שפות, אך כרטיס המודל אינו מפרט תוצאות מבחן ייעודיות לעברית. תצטרכו להריץ עליו מדגם של מסמכים מקומיים כדי לוודא שהוא לא מתבלבל בסדר האותיות או בניקוד.

במה שונה הגרסה הזו מהמודל המקורי של DeepSeek?

אנשי Unsloth ערכו את המבנה שלו כדי שיוכל לעבוד ישירות עם גרסאות transformers עדכניות יותר, הן להסקה והן לאימון נוסף, ללא שינוי ברמת הדיוק של המשקלים המקוריים.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של NVIDIA שתומך ב־CUDA 11.8 ומעלה, עם מספיק זיכרון להחזיק משקל של 6.3 גיגה-בייט ועוד מקום לחישובים, כך שכרטיס של 12 או 16 גיגה-בייט VRAM יספיק לרוב המשימות. ההרצה דורשת התקנה של flash-attn והפעלת קוד עם trust_remote_code ישירות מספריית transformers.

אם יש לכם שרת מקומי עם חומרה מתאימה, ההרצה משתלמת מאוד ושומרת על פרטיות מלאה. אם אתם מעבדים רק מסמכים בודדים ביום, הקמה ותחזוקה של סביבת פייתון ייעודית עם התלויות המדויקות תהיה כנראה טרחה גדולה מדי לעומת שליחה לשירות חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="unsloth/DeepSeek-OCR-2")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗