GPT
H

HPD-Parsing

קוד פתוח

PaddlePaddleapache-2.02026-07-21

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • image-text-to-text

המודל מנתח מסמכים שלמים במקביל במקום טוקן אחרי טוקן. הוא פותר את צוואר הבקבוק הרגיל של פיענוח סדרתי ומגיע לקצב עיבוד חריג בגודל קומפקטי.

  • 1.1Bפרמטרים
  • 2.6 GBמשקל הקבצים
  • 2,292הורדות בחודש
  • 99לייקים

מה זה

המודל מתבסס על InternVL3.5-1B ונועד להמיר תמונות של עמודים ומסמכים לטקסט ולמבנה. בניגוד למודלי ראייה רגילים שרצים על כל העמוד בסדרה אחת ארוכה, הוא מפריד בין ניתוח המבנה הכללי לבין קריאת הטקסט המקומית. ענף ראשי ממפה את השלד של המסמך ומפצל ענפי משנה שמפענחים אזורים נפרדים במקביל, כשיחד איתם פועל מנגנון חיזוי מרובה טוקנים שמקצר את צעדי היצירה.

במדד OmniDocBench v1.6 הוא מציג דיוק כולל של 94.91% ומגיע לשיא של 4,752.1 טוקנים לשנייה תחת עומס. המשמעות בפועל היא שהוא מתמודד עם פריסות מסמך מורכבות בדיוק גבוה, ובמקום שהעיבוד יזחל ככל שהעמוד עמוס יותר בטקסט, המבנה המקבילי שומר על זמני תגובה נמוכים.

מתאים ל

  • חילוץ מסמכים באנגלית ובסינית

    הוא מגיע לדיוק של 94.91% במבחן OmniDocBench v1.6 ומבצע דיגיטציה מדויקת של מבנה הדף.

  • עיבוד עמודים עמוסים בטקסט

    מנגנון הפיצול המקבילי מוריד עד פי 18 את צעדי הפענוח במסמכים ארוכים.

  • פיענוח בשרתים מקומיים

    המודל שוקל 2.6 גיגה-בייט בלבד ונכנס בלי בעיה למאיץ גרפי יחיד ללא תלות ברשת.

איפה זה נופל

התמיכה מוגבלת לשפות אנגלית וסינית בלבד, ולכן מסמכים בעברית או בערבית לא יפוענחו כראוי ולא מיועדים למודל הזה. חיסרון משמעותי נוסף הוא התלות בתוכנה מותאמת. אי אפשר להרים שרת vLLM רגיל מהקופסה ולקבל את הביצועים המלאים, אלא חייבים להסתמך על אימג' דוקר ייעודי שיושב במאגר של באידו או להתקין קובץ גלגל ספציפי של הפרויקט. מי שמחפש פתרון סטנדרטי שישתלב בתשתית קיימת ללא התאמות קוד ייתקל בחיכוך מיותר.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לסריקת מסמכים בעברית?

לא. המודל אומן והוגדר לעבודה באנגלית ובסינית בלבד. הוא לא יזהה נכון אותיות בעברית או כיווניות מימין לשמאל.

האם אני חייב את גרסת ה־vLLM המותאמת כדי לעבוד איתו?

עבור בדיקות ראשוניות אפשר להריץ אותו עם ספריית transformers רגילה באמצעות הפונקציה הייעודית model.generate_hpd. עם זאת, הפעלה כזו מעבדת תמונה בודדת בלבד וזוללת זיכרון, כך שעבור עבודה אמיתית בקצב גבוה חייבים להשתמש בבילד המותאם של vLLM שמממש את פיצול הענפים.

איך מריצים

כדי להגיע לביצועים המדווחים צריך להריץ אותו דרך גרסה מותאמת של vLLM 0.17.1 שמיישמת פיצול בקשות דינמי, וזמינה כאימג' דוקר או קובץ גלגל עצמאי הדורש דרייבר אנבידיה עם CUDA 12.8 ומעלה. אפשר להריץ אותו גם בספריית transformers רגילה עם פונקציית ייעודית, אבל המפרסמים מציינים שזו גרסת ייחוס בלבד לבאץ' בודד והיא איטית וכבדה יותר בזיכרון.

משקל הקבצים הוא 2.6 גיגה-בייט וגודלו 1.1 מיליארד פרמטרים, כך שכרטיס מסך מודרני פשוט עם 8 עד 12 גיגה זיכרון יחזיק אותו בקלות. עם זאת, נתוני השיא של אלפי טוקנים לשנייה נמדדו על חומרת שרת כבדה מדגם NVIDIA A800 בנפח 80 גיגה ובאץ' של 512, כך שעל חומרה צנועה תקבלו קצבים נמוכים בהרבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="PaddlePaddle/HPD-Parsing")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מופצים תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש כמעט ללא הגבלה. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית בקוד ובמוצר הסופי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗