GPT
T

typhoon-ocr-7b

קוד פתוח

typhoon-aiapache-2.02025-05-14

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • OCR

מודל ייעודי להמרת מסמכים סרוקים למרקאדאון וטבלאות HTML, שפותח במיוחד עבור תאילנדית ואנגלית. הוא מבוסס על ארכיטקטורת Qwen2.5-VL ומכוון לפיענוח מדויק של מבנים מורכבים.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 12,958הורדות בחודש

מה זה

המודל מתמקד בקריאת מסמכים בעולם האמיתי, כמו דוחות כספיים, טפסים ממשלתיים, קבלות ותפריטים. במקום להחזיר גוש טקסט פשוט, הוא פולט מרקאדאון עבור הטקסט השוטף, קוד HTML מדויק עבור טבלאות עם תאים ממוזגים, ותגיות מיוחדות לתיאור תרשימים ואיורים. התיאור הוויזואלי מפרק את התמונות לזיהוי אלמנטים, ניתוח הקשר, חילוץ כיתובים וסיכום מבני.

המפתחים מעידים שבמבחנים על מסמכים תאילנדיים עם פריסה מורכבת וטקסט מעורב, הוא עוקף מודלים כמו GPT-4o ו־Gemini 2.5 Flash. עם זאת, אין כאן תמיכה בעברית, והאימון מתמקד כולו באנגלית ובתאילנדית.

מתאים ל

  • פיענוח דוחות כספיים

    חילוץ מדויק של טבלאות פיננסיות מורכבות לקוד HTML כולל תאים ממוזגים וטקסט באנגלית.

  • דיגיטציה של קבלות ומסמכים

    המרת קבלות וכרטיסים במבנה גמיש ישירות למרקאדאון מסודר לקריאה ולניתוח.

  • עיבוד מסמכים בתאילנדית

    טיפול בטפסים ממשלתיים ובטקסטים מעורבים בתאילנדית ואנגלית שבהם מודלים כלליים מתקשים.

איפה זה נופל

זה לא מודל שיחה ולא כלי לשאלות ותשובות על תמונות, אלא רכיב OCR ממוקד. הוא עובד אך ורק עם הפרומפט המובנה שלו שמחלץ עוגני טקסט מהמסמך, וכל ניסיון לתת לו פרומפט חופשי פשוט ייכשל. המפתחים מודים שבספרים עם הרבה איורים מגוונים הביצועים יורדים, כי המודל מתקשה לפענח תמונות שונות ומורכבות. אין מנגנוני הגנה מובנים, ויש סיכון להזיות בטקסט שחובה לבדוק ידנית.

שאלות
נפוצות

האם אפשר להשתמש במודל לזיהוי מסמכים בעברית?

לא. המודל אומן והוגדר באופן רשמי עבור אנגלית ותאילנדית בלבד. ניסיון להריץ עליו מסמכים בעברית יוביל לפלט שגוי או להזיות.

למה המודל לא מחזיר תשובות לשאלות על המסמך?

הוא אינו מודל שיחה כללי ואין לו יכולות VQA. המטרה שלו היא בלעדית חילוץ והמרת המסמך למרקאדאון, והוא מתוכנן לפעול אך ורק עם פרומפט קבוע מראש.

באיזה פורמט מומלץ להריץ אותו מקומית?

היוצרים ממליצים להשתמש ב־vLLM או בגרסת Ollama הרשמית שלהם. קבצי GGUF דרך llama.cpp או LM Studio סובלים מבעיות דיוק מוכרות לפי כרטיס המודל.

איך מריצים

המשקל הכולל של הקבצים עומד על 15.5 גיגה בייט בדיוק bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגה בייט זיכרון כדי לטעון אותו ולעבד מסמכים. המפתחים ממליצים במפורש להריץ אותו דרך vLLM ולא דרך ספריית transformers הרגילה, תוך הגבלת אורך ההקשר ל־32,000 טוקנים בשרת. יש גם אפשרות להשתמש בגרסת Ollama, אך מודגש שקבצי GGUF ב־llama.cpp או ב־LM Studio סובלים מבעיות דיוק.

אם אין לכם שרת ייעודי עם מאיץ גרפי מתאים, המפתחים מספקים ספריית פייתון בשם typhoon-ocr שמאפשרת להתחבר ישירות ל־API שלהם עם מפתח תואם OpenAI.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="typhoon-ai/typhoon-ocr-7b")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות משוחררים תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים. יחד עם זאת, השימוש כפוף לתנאי השימוש ומדיניות הפרטיות של OpenTyphoon המצוינים בכרטיס המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗