GPT
H

HunyuanOCR

קוד פתוח

tencentother2025-11-18

  • transformers
  • safetensors
  • hunyuan_vl
  • image-text-to-text
  • ocr

מודל ראייה ושפה קל משקל שמיועד לעיבוד מסמכים מורכבים, חילוץ טקסט ותרגום מתמונות. הוא מציע שילוב של מנגנון פענוח מהיר עם תמיכה בהרצה מקומית על מחשבים אישיים.

  • 1.1Bפרמטרים
  • 131,072טוקנים בהקשר
  • 4.3 GBמשקל הקבצים
  • 667,966הורדות בחודש

מה זה

מדובר במודל ראייה ושפה ייעודי לעולם הראייה הממוחשבת ומסמכים, שמרכז תחת קורת גג אחת פענוח מסמכים מלא, זיהוי ומיקום טקסט בתמונה, חילוץ מידע מובנה ותרגום ישיר מתמונות. במקום להגדיל את הארכיטקטורה, הגרסה הנוכחית מתמקדת בשיפור מהירות הפענוח והרחבת היכולות לקצוות בעייתיים כמו כתב עתיק, שפות דלות משאבים ושאלות ותשובות על גבי כמה תמונות ברצף.

השוני המרכזי מול מודלים אחרים במשקל הזה טמון בטכנולוגיית ההאצה שלו. פענוח מסמכים צפופים עם טבלאות ונוסחאות מייצר רצף פלט ארוך שמאט מודלים רגילים, וכאן שילבו מודל טיוטה קל מבוסס דיפוזיה שמציע מספר טוקנים במקביל והמודל הראשי מאמת אותם במעבר יחיד. בנוסף, הוא מאפשר עבודה מול תמונות ברזולוציית 4K ומציע תבניות מובנות מראש לחילוץ תרשימים, נוסחאות בלאטך וטבלאות בפורמט קוד.

מתאים ל

  • המרת דוחות לפורמט מובנה

    חילוץ מסמכים עמוסים ישירות למרקडाउन, כולל המרת טבלאות לפורמט קוד ונוסחאות מתמטיות ללאטך.

  • עיבוד תמונות במסופי קצה

    הרצה מקומית על מחשבים ניידים באמצעות המרת המשקלים לעבודה חלקה דרך llama.cpp.

  • חילוץ ותרגום טקסט מתמונה

    זיהוי כתב ותרגום ישיר של תוכן ויזואלי מאנגלית לשפות נתמכות בפעולה רציפה אחת.

איפה זה נופל

המודל פותח בעיקר עבור שפות סינית ואנגלית, ואין בכרטיס כל מידע או אינדיקציה לגבי תמיכה באותיות עבריות או בשפות הנכתבות מימין לשמאל. שימוש בו לחילוץ מסמכים בעברית עלול להיכשל לחלוטין וידרוש בדיקה יזומה מראש. בנוסף, חלק גדול מהתבניות ומהפרומפטים הרשמיים בנויים סביב הנחיות בשפה הסינית.

שאלות
נפוצות

האם אני יכול להריץ את המודל על המחשב הנייד שלי?

כן. המודל תומך בהמרה לפורמט GGUF וניתן להריץ אותו דרך מנוע llama.cpp על מעבד רגיל או על כרטיס מסך פשוט, בלי להזדקק לשרת ייעודי.

מה תפקידו של מודל הטיוטה שמגיע בקבצים?

מודל הטיוטה מייצר הצעות לרצפי מילים במקביל, והמודל הראשי מאשר אותן בפעימה אחת. הדבר מקצר משמעותית את זמן ההמתנה בעת סריקת מסמכים מרובי מלל מבלי לפגוע באיכות הפלט.

איך מריצים

הסביבה הרשמית של הפרויקט דורשת פייתון 3.10 ומעלה עם גרסת CUDA 13 ייעודית, וכוללת שילוב של vLLM וספריית flash-attn לצורך הרצה על גבי שרתים. יש לוודא התקנה של ספריית transformers בגרסה 5.13.0 לפחות לצורך טעינה ישירה. משקל הקבצים עומד על 4.3 גיגה בייט, כך שכרטיס מסך ביתי יחיד של אנבידיה יספיק כדי לטעון את כל המשקלים יחד עם מודל הטיוטה.

מי שאין לו כרטיס תואם או גישה לשרת לינוקס יכול להמיר את המשקלים לפורמט GGUF ולהריץ אותם על מעבד רגיל או מחשב נייד באמצעות llama.cpp. עם זאת, התקנת סביבת השרת הרשמית עם מנגנון ההאצה דורשת התעסקות עם תלויות מערכת מדויקות, כך שאם הפרויקט שלכם זקוק לחילוץ מזדמן בלבד, עדיף להשתמש בפתרון מוכן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="tencent/HunyuanOCR")
print(pipe("שלום"))

הרישיון

המודל כפוף לרישיון מותאם אישית של טנסנט. זהו אינו רישיון קוד פתוח סטנדרטי מסוג אפאצ'י או MIT, ולכן לפני שילובו במוצר מסחרי חובה לקרוא את קובץ התנאים המלא במאגר ולוודא שהשימוש המיועד אינו מפר את המגבלות של החברה.

הרישיון המלא בעמוד המודל ↗