GPT
N

NuMarkdown-8B-Thinking

קוד פתוח

numindmit2025-07-29

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • OCR

numind עומדים גם מאחורי NuExtract 2.0 by NuMind, ויש עליו סקירה כאן.

מודל ראייה שממיר תמונות של מסמכים למרקרון נקי עבור פייפליינים של חיפוש. הוא מייצר טוקנים של חשיבה כדי לפענח מבנה וטבלאות לפני הפלט הסופי.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 359,197הורדות בחודש

מה זה

מדובר במודל ראייה מבוסס קוון שעבר כוונון ייעודי ומבוסס למידת חיזוק לחילוץ טקסט ממסמכים. הרעיון המרכזי כאן הוא חשיבה לפני פליטת הטקסט, כלומר המודל מנתח את הפריסה הגרפית של העמוד ורק אז בונה את המרקרון. זה מכוון ישירות למקרים שבהם מסמכים שוברים מנועי טקסט רגילים, כמו טבלאות מסובכות או עימוד רב טורי מוזר.

בבדיקות של היוצרים מול מדרגים אנושיים, הוא עוקף מודלים כלליים חזקים כמו ג'יפיטי ארבע או ופתרונות ייעודיים קטנים יותר, ומגיע קרוב מאוד למודל החשיבה של ג'מיני פלאש. המשמעות בפועל היא פחות הזיות במיקום של שדות ויכולת טובה יותר להבין איך טבלה מורכבת אמורה להיראות כטקסט קריא למכונה, במיוחד בהכנת דאטה למערכות אחזור מידע.

מתאים ל

  • הכנת מסמכים למערכות RAG

    חילוץ מדויק של טבלאות ומבנה מורכב למרקרון נקי שמתאים לחלוקה למקטעים.

  • דיגיטציה של דו״חות כספיים

    המרה של עמודים עמוסי מספרים ועימוד לא סטנדרטי לטקסט מובנה.

  • עיבוד מקומי של מסמכים רגישים

    הרצה מקומית על כרטיס בודד ללא צורך בשליחת המידע לשירותי ענן חיצוניים.

איפה זה נופל

זמן הריצה שלו יכול להיות ארוך ולא צפוי. המודל מייצר טוקנים של חשיבה שיכולים להגיע מפי חמישית ועד פי חמישה מגודל הפלט הסופי עצמו, מה שאומר שמסמך מורכב ייקח משמעותית יותר זמן עיבוד ומשאבים ממודל רגיל. בנוסף, האימון התבסס על נתונים סינתטיים ממסמכים ציבוריים, כך שאיכות הזיהוי שלו על מסמכים בעברית או על כתב יד לא נבדקה ולא מובטחת כלל.

שאלות
נפוצות

כמה זמן לוקח לו לעבד עמוד?

זה תלוי ישירות במורכבות הדף. המודל מייצר טוקנים של מחשבה לפני שהוא פולט את הטקסט, ובמקרים קשים כמות הטוקנים הזו יכולה להיות גדולה פי חמישה מכל המלל של המסמך, מה שמאט את הקצב לעומת פתרונות זיהוי טקסט קלאסיים.

הוא מתאים למסמכים בעברית?

אין שום מידע או תיעוד על אימון או בדיקה שלו בעברית. הבסיס שלו הוא מודל רב לשוני, אבל הכוונון נעשה על מסמכים ציבוריים באנגלית, ולכן חובה לבדוק אותו על מדגם שלכם לפני שמסתמכים עליו.

איך מריצים

המודל שוקל כחמישה עשר וחצי גיגה בפורמט ביפלואוט שש עשרה, כך שכרטיס מסך בודד עם עשרים וארבעה גיגה זיכרון יחזיק אותו בקלות עם וי אל אל אם. ההרצה דורשת תמיכה במודלי ראייה ומאפשרת כרגע עיבוד של תמונה בודדת בכל בקשה.

אם אתם צריכים לפענח עמוד בודד פעם בשעה, עדיף להשתמש בפתרון ענן או בממשק מרוחק במקום להחזיק שרת ייעודי דולק. החומרה המקומית משתלמת ברגע שאתם מעבדים כמויות של מסמכים רגישים שאסור להוציא החוצה, או כשיש נפח קבוע של קבצים שמצדיק כרטיס תצוגה ייעודי.

from transformers import pipeline

pipe = pipeline("image-to-text", model="numind/NuMarkdown-8B-Thinking")
print(pipe("שלום"))

הרישיון

רישיון אם איי טי פתוח לחלוטין. מותר להשתמש במודל לכל מטרה, כולל מוצרים מסחריים וסגורים, לשנות אותו ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗