GPT
P

PaddleOCR-VL-1.5-GGUF

קוד פתוח

PaddlePaddleapache-2.02026-02-26

  • gguf
  • endpoints_compatible
  • conversational

מודל ראייה ושפה קטן של 0.9B פרמטרים שמפענח מסמכים סרוקים, טבלאות ונוסחאות. הוא נכנס לכל שרת בסיסי ומיועד למי שרוצה חילוץ טקסט מקומי בלי לשלם על שירותי ענן.

  • 1.7 GBמשקל הקבצים
  • 15,771הורדות בחודש
  • 38לייקים

מה זה

מדובר במודל רב משימתי זעיר לחילוץ תוכן מתמונות מסמכים. הגודל שלו עומד על 0.9B פרמטרים בלבד, אבל הוא יודע להתמודד עם אתגרים פיזיים כמו עיוותי סריקה, ניירות מקומטים, צילום מסך ותאורה לא אחידה. מעבר לקריאת טקסט רציף, הוא מזהה חותמות, מפענח טבלאות, מחלץ גרפים ומתמודד עם נוסחאות מתמטיות, והוא מגיע בפורמט GGUF להרצה ישירה.

במדד OmniDocBench v1.5 המודל מציג דיוק של 94.5%. במבחן המציאות זה אומר שהוא מפרק מבנה של דף שלם בצורה אמינה יותר מרוב הפתרונות הפתוחים בגודל הזה, בלי לדרוש שרשרת מורכבת של כמה מודלים נפרדים לזיהוי ולחיתוך. עם זאת, אין בתיעוד שום מידע על תמיכה בשפות עם כיווניות מימין לשמאל או בעברית, ולכן צריך לצאת מנקודת הנחה שהוא אומן בעיקר על אנגלית וסינית.

מתאים ל

  • חילוץ נתונים מטבלאות

    פרומפט ייעודי של Table Recognition ממיר מבנה טבלאי מורכב ישירות לטקסט מובנה.

  • זיהוי חותמות במסמכים

    המודל כולל אימון ספציפי לקריאת חותמות ומסמכים רשמיים עם פרומפט Seal Recognition.

  • פיענוח דפים באיכות נמוכה

    הוא נבנה לעמוד בסריקות עקומות, צילומי מסך ותאורה גרועה שנכשלים ב־OCR רגיל.

איפה זה נופל

משימת איתור מיקום, שנקראת spotting, מחייבת שינוי ידני של מטא דאטה בקובץ ה־GGUF כדי להגדיל את מגבלת הפיקסלים ל־1605632, אחרת הפעולה לא עובדת כמו שצריך. בנוסף, משתמשי מק תלויים ב־Docker, והכרטיס לא מספק נתונים על קריאת עברית, כך שסביר מאוד שהוא ייכשל לחלוטין על מסמכים מקומיים.

אותה משפחה

PaddleOCR-VL-1.5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

התיעוד והמדדים שפורסמו מתרכזים בביצועים כלליים ובמדד OmniDocBench, ואין שום אזכור לתמיכה בעברית. רוב הסיכויים שהוא מותאם לאנגלית וסינית בלבד, ולכן אם המטרה היא קריאת מסמכים בעברית צריך לבדוק אותו ידנית על כמה דוגמאות לפני שבונים עליו.

איך מבקשים ממנו משימה ספציפית כמו נוסחה או טבלה?

ההפרדה בין המשימות נעשית דרך הטקסט ששולחים בהנחיה. כותבים בתחילת הפנייה תחילית ייעודית כמו Formula Recognition או OCR בהתאם לצורך, והמודל מכוון את הפלט לאלמנט המבוקש.

איך מריצים

המודל שוקל 1.7 גיגה בייט בלבד בחמישה קבצים, מה שאומר שאפשר להריץ אותו כמעט על כל כרטיס מסך ביתי או ישירות על המעבד עם llama.cpp. מריצים את שרת הראייה המקומי באמצעות פקודת llama-server עם קובץ המודל וקובץ הפרויקציה mmproj, ואז פונים אליו דרך הצינור הרשמי של ספריית paddleocr או בקריאת HTTP פשוטה בטמפרטורה אפס.

ההתקנה דורשת את פייתון עם paddlepaddle-gpu מגרסה 3.2.1 ומעלה וגרסה תואמת של safetensors. אם אתם עובדים על macOS, החומר מציין מפורשות שצריך להרים סביבת Docker כדי שהכל יעבוד. למי שצריך לעבד עשרות אלפי עמודים בדקה, הקמה של שרתי GPU עצמאיים תדרוש תחזוקה, אבל לנפחים נמוכים או למי שחייב שהמידע לא ייצא מהרשת המקומית, ההרצה כאן פשוטה וזולה משמעותית מכל חלופה.

ollama run hf.co/PaddlePaddle/PaddleOCR-VL-1.5-GGUF:PaddleOCR-VL-1.5-mmproj

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

5 קבצים במאגר, 1.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך מוצרים. אתם יכולים לשלב אותו בשירות שלכם בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗