GPT
N

Nanonets-OCR-s-GGUF

קוד פתוח

unslothרישיון לא דווח2025-06-16

  • transformers
  • gguf
  • OCR
  • unsloth
  • pdf2markdown

גרסת GGUF למודל OCR שממיר מסמכים למרק־דאון מובנה עם תגיות ייעודיות. הוא מתאים למי שרוצה להכין מסמכים סרוקים לקריאה של מודלי שפה.

  • 53.5 GBמשקל הקבצים
  • 7,926הורדות בחודש
  • 71לייקים

מה זה

המודל לוקח תמונות של מסמכים ומפרק אותן לטקסט במבנה מרק־דאון, אבל במקום סתם לחלץ אותיות הוא מזהה אלמנטים מורכבים בתוך הדף. הוא יודע להמיר נוסחאות מתמטיות לתחביר LaTeX תקני, מבודד חתימות לתוך תגית ייעודית, ושולף סימני מים בנפרד מהטקסט הראשי כדי לא ללכלך את הפלט.

חוץ מטקסט רציף, הוא מתמודד עם טבלאות מורכבות ומייצר מהן מרק־דאון או HTML, ממיר תיבות סימון לסמלי יוניקוד, ומוסיף תיאור מילולי לתרשימים ולוגואים. המטרה כאן היא לייצר קלט נקי שתוכלו לזרוק ישר לתוך מודל שפה בלי שלבי עיבוד מקדימים מתישים.

מתאים ל

  • הזנת מסמכים ל־LLM

    הוא ממיר סריקות למרק־דאון עם תיוג סמנטי של תמונות וסימני מים, מה שמקל על הזנת ההקשר למודל שפה.

  • דיגיטציה של טפסים

    המודל מתרגם תיבות סימון ליוניקוד ומבודד חתימות לתוך תגיות ייעודיות שקל לפלטר בקוד.

  • חילוץ מאמרים מדעיים

    הוא מזהה משוואות ופולט אותן בפורמט LaTeX תקני ששומר על מבנה הנוסחה המקורי.

איפה זה נופל

הכרטיס מגדיר את המודל לשפה האנגלית בלבד, כך שאם יש לכם מסמכים בעברית או שילוב שפות מקומי, סביר מאוד שתקבלו ג'יבריש או טעויות קשות. לא מפורסמים כאן ציוני דיוק רשמיים מול בנצ'מרקים, ולכן חייבים לבדוק אותו על סריקות עקומות, צילומים מטושטשים ומסמכים מהעולם האמיתי לפני שמסתמכים עליו בצינור עיבוד אוטומטי.

שאלות
נפוצות

האם המודל יודע לקרוא מסמכים בעברית?

המודל הוגדר רשמית לאנגלית בלבד. אם תזינו לו טפסים בעברית הוא כנראה ייכשל בחילוץ הטקסט, ולכן אי אפשר להסתמך עליו למסמכים מקומיים.

איך הכי פשוט לשלב אותו בקוד קיים?

אפשר להריץ אותו דרך ספריית docext הרשמית שמוזכרת בתיעוד, או לפתוח שרת vLLM מקומי ולשלוח אליו קריאות ישירות מהאפליקציה שלכם.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־53.5 ג'יגה־בייט שמחולקים בין קבצי GGUF שונים של אנלאות'. כדי להריץ קוונטיזציות כבדות מקומית תצטרכו כרטיס מסך חזק עם זיכרון וידאו נדיב או מספיק RAM במעבד, בהתאם לקובץ שתורידו. ההרצה נעשית ישירות מול ספריות שתומכות בפורמט, או דרך vLLM ו־docext לפי התיעוד של מודל המקור.

אם אין לכם כרטיס מתאים לפרוס עליו עשרות ג'יגה־בייט, להרים תשתית עצמאית רק בשביל כמה דפים בשבוע זה מיותר. במקרה כזה עדיף לקחת שירות מנוהל או API חיצוני ולא להתעסק עם ניהול זיכרון ידני.

ollama run hf.co/unsloth/Nanonets-OCR-s-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

למודל הזה לא דווח רישיון במאגר. מבחינה משפטית, היעדר רישיון מפורש אומר שאין לכם היתר שימוש ברור, בטח שלא למוצר מסחרי. לפני שמטמיעים אותו במערכת פעילה, חייבים לבדוק מול היוצרים המקוריים של המודל מה תנאי ההפצה שלהם.

הרישיון המלא בעמוד המודל ↗