GPT
P

pdf-document-layout-analysis

קוד פתוח

HURIDOCSapache-2.02024-05-22

  • transformers
  • endpoints_compatible

הכלי מפרק מסמכי PDF למקטעים מבניים כמו כותרות, טבלאות ותמונות ושומר על סדר הקריאה. הוא מתאים למי שבונה צינור עיבוד ל־RAG או חילוץ מידע ורוצה שירות עצמאי בקונטיינר.

  • 122 MBמשקל הקבצים
  • 135הורדות בחודש
  • 130לייקים

מה זה

המאגר מכיל שרת מבוסס FastAPI ודוקר שמנתח מבנה של קובצי PDF ומזהה אחד-עשר סוגי תוכן שונים, מטקסט רץ ועד נוסחאות מתמטיות. במקום להסתפק בחילוץ גולמי של מחרוזות, הוא מייצא קואורדינטות מדויקות של כל מקטע וממיר את התוכן לפורמטים כמו Markdown או HTML.

יש כאן שני מנועים שונים לבחירה. הראשון מבוסס על Vision Grid Transformer של עליבאבא ומשתמש במידע ויזואלי של העמוד כולו כדי להגיע לדיוק גבוה. השני מבוסס על צמד מודלי LightGBM שמנתחים פלט XML מתוכנת Poppler, מה שמאפשר לו לרוץ מהר מאוד על מעבד רגיל בלי להסתמך על תמונת הדף.

מתאים ל

  • הכנת מסמכים למערכות RAG

    הפרדה מדויקת בין כותרות לפסקאות מאפשרת חיתוך מקטעים חכם במקום לפצל שורות באופן עיוור.

  • המרת דוחות ל־Markdown

    שמירה על מבנה עמודות, טבלאות וסדר קריאה מקורי של דוחות טכניים מורכבים ישירות לפורמט נקי.

  • עיבוד אצוות על מעבדים

    מצב ה־LightGBM מעבד אלפי קבצים במהירות של חצי שנייה לעמוד ללא צורך בכרטיסי מסך יקרים.

איפה זה נופל

חבילת הדוקר והתלויות דורשות 10GB פנויים בדיסק, והאיטיות של מודל הראייה על גבי מעבד פוסלת אותו משימוש בזמן אמת ללא כרטיס מסך. דגם ה־LightGBM המהיר אמנם חסכוני, אך הוא עיוור לחלוטין לקונטקסט ויזואלי ומסתמך רק על חילוץ טקסט פנימי, מה שיוביל לטעויות במסמכים מורכבים. בנוסף, מודל ה־DocLayNet שעליו הם אומנו ממוקד בעיקר במסמכים באנגלית, כך שדיוק הניתוח בעברית אינו מובטח וידרוש בדיקה יסודית מראש.

שאלות
נפוצות

האם חייבים כרטיס מסך כדי להריץ את השירות?

לא, השירות יעלה גם על מחשב רגיל עם 2GB זיכרון פנוי. יחד עם זאת, מודל הראייה המדויק דורש כרטיס מסך כדי לפעול בזמן סביר, ועל מעבד בלבד מומלץ להשתמש בדגל הריצה המהירה של LightGBM.

איך עובד התרגום המובנה במסמכים?

השירות מתממשק עם קונטיינר מקומי של Ollama ומריץ מודלים כמו gpt-oss. הוא מתרגם את הטקסט אחרי שלב הזיהוי תוך שמירה על המבנה והתגיות, אך איכות התרגום תלויה לחלוטין במודל השפה שבחרתם להוריד.

איך מריצים

ההפעלה המעשית דורשת Docker Compose ופקודת make פשוטה שמריצה את השרת על פורט 5060. אפשר לעבוד על מעבד בלבד עם מינימום של 2GB זיכרון RAM, אבל מודל ה־VGT הכבד זוחל בקצב של 13.5 שניות לעמוד על מעבד i7, לעומת 1.75 שניות עם כרטיס מסך שיש לו לפחות 5GB זיכרון ייעודי.

אם מפעילים את דגל הריצה המהירה fast=true, המערכת עוברת למודלי ה־LightGBM וגוזרת עמוד ב־0.42 שניות על המעבד. אין כאן מודל ענן מוכן לצריכה ישירה, כך שאם אין לכם שרת ייעודי או כוח עיבוד מקומי, תצטרכו להקים שרת בעצמכם או לבחור שירות חיצוני אחר.

from transformers import pipeline

pipe = pipeline("text-generation", model="HURIDOCS/pdf-document-layout-analysis")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 122 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון Apache 2.0 מאפשר שימוש חופשי לחלוטין, כולל שינוי הקוד, הטמעה במוצרים מסחריים והפצה פנימית או חיצונית. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי, בלי חובת פתיחה של הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗