GPT
P

POINTS-Reader

קוד פתוח

tencentapache-2.02025-08-15

  • transformers
  • safetensors
  • text-generation
  • image-text-to-text
  • conversational

מודל ראייה ושפה קומפקטי שממיר תמונות מסמכים לטקסט נקי בלי שלבי עיבוד נוספים. הוא עוקף מודלים ענקיים במבחני דיוק באנגלית ובסינית ורץ מהר.

  • 4.1Bפרמטרים
  • 7.7 GBמשקל הקבצים
  • 185הורדות בחודש
  • 103לייקים

מה זה

מדובר במודל שמשלב רכיב ראייה NaViT של 600 מיליון פרמטרים עם מודל שפה מסוג Qwen2.5 בנפח של 3 מיליארד פרמטרים. המבנה שלו ממוקד לחלוטין במשימה בודדת. אתם מעבירים תמונת מסמך יחד עם הנחיה קבועה, והוא מחזיר ישירות את הטקסט החוצה כמחרוזת אחת, בלי צורך לחבר צינורות עיבוד נפרדים לזיהוי פסקאות או טבלאות.

במדד OmniDocBench הוא מציג שגיאת עריכה נמוכה מאוד של 0.133 באנגלית ושל 0.212 בסינית. המספרים האלה מציבים אותו ברמת דיוק שעוקפת שירותים כמו Mathpix ומודלים כלליים גדולים בהרבה כמו GPT4o וגרסאות ה־72B של Qwen. היתרון הבולט שלו הוא בזיהוי מבנה טבלאות ובשמירה על סדר קריאה נכון של עמודות, נקודה שבה כלים קלאסיים נוטים להישבר.

מתאים ל

  • המרת מאמרים אקדמיים

    הוא מחלץ נוסחאות מתמטיות ושומר על מבנה טבלאות מדויק באנגלית בלי לפרק את המאמר לכלים נפרדים.

  • דיגיטציה של חוזים

    שומר על סדר קריאה נכון במסמכים מודפסים באנגלית ומפיק טקסט ישיר בלי שלבי ניקוי נוספים.

  • מערכות עיבוד מהירות

    בזכות רכיב הראייה הקטן והתמיכה ב־SGLang הוא מספק תפוקת עיבוד גבוהה על חומרה חסכונית.

איפה זה נופל

הכרטיס מצהיר בפירוש על חוסר יכולת להתמודד עם שפות שאינן אנגלית או סינית, ולכן הוא לא מתאים למסמכים בעברית. עימוד מורכב מאוד כמו עיתונים גורם לו לפספס קטעים או להיכנס ללולאות של חזרות טקסט, תופעה שמחייבת לפעמים להעלות את רזולוציית התמונה כדי למזער אותה. הוא גם נכשל בזיהוי כתב יד על גבי פתקים וקבלות.

שאלות
נפוצות

האם המודל תומך במסמכים בעברית?

לא. המודל אומן ותוכנן לעבוד אך ורק עם מסמכים באנגלית ובסינית, ואין לו תמיכה בשפות אחרות.

מה אפשר לעשות כשהמודל חוזר על אותן מילים בפלט?

התיעוד ממליץ להעלות את רזולוציית תמונת הקלט. במסמכים מורכבים במיוחד זו בעיה מוכרת של המודל שלעיתים גורמת לחזרות.

האם צריך כרטיס מסך מרובה ליבות כדי לפרוס אותו?

ממש לא. המודל מכיל 4.1 מיליארד פרמטרים בלבד ומוגדר לרוץ על כרטיס בודד גם בסביבת שרת מהירה כמו SGLang.

איך מריצים

המודל שוקל 7.7 ג'יגה בייט בפורמט bfloat16, כך שכרטיס מסך ביתי או שרת זול עם 12 עד 16 ג'יגה זיכרון וידאו מספיק לחלוטין כדי להריץ אותו. מריצים אותו ישירות דרך ספריית transformers בפייתון 3.10 עם PyTorch 2.5.1 וגרסת CUDA 12.1, או בתוך מחברת עבודה בענן.

לסביבת ייצור עם נפחי עבודה גדולים, הצוות הוסיף תמיכה בשרת SGLang על כרטיס בודד עם פרמטר trust-remote-code, מה שמספק קצב עיבוד גבוה בהרבה. אין למודל גרסאות משקל שונות, ואם המטרה היא סריקת מסמכים בסינית או אנגלית בהיקף רחב, הרצה עצמית שלו תהיה חסכונית משמעותית מתשלום לפי עמוד לספקי ענן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="tencent/POINTS-Reader")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות את הקוד שלו, לשלב אותו במוצרים פנימיים או חיצוניים ולהפיץ אותו חופשי. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗