GPT
H

h2ovl-mississippi-800m

קוד פתוח

h2oaiapache-2.02024-10-16

  • transformers
  • safetensors
  • h2ovl_chat
  • feature-extraction
  • gpt

יש כאן גם סקירה על H2O AI עצמו.

מודל ראייה ושפה קומפקטי במיוחד שנועד לחילוץ טקסט מתמונות ומסמכים. הוא מתאים למי שחייב מודל קל משקל שרץ מקומית בלי לבלוע זיכרון.

  • 826Mפרמטרים
  • 1.5 GBמשקל הקבצים
  • 52,983הורדות בחודש
  • 40לייקים

מה זה

המודל מבוסס על סדרת H2O-Danube של החברה, ואומן על 19 מיליון זוגות של תמונה וטקסט עם התמקדות ברורה בסריקת מסמכים, טבלאות וגרפים. הרעיון כאן הוא לקחת ארכיטקטורת שפה קטנה ולחבר אותה לרכיב ראייה בלי לייצר מפלצת שדורשת שרת ייעודי, כאשר הדגש העיקרי הוא קריאת נתונים מובנים והמרתם לפורמט טקסטואלי.

במבחני OCRBench הוא מגיע לציון של 751 נקודות. זה נתון שמציב אותו קרוב מאוד למודלים כבדים בהרבה כמו InternVL2-2B שקיבל 781 או Phi-3-Vision שעומד על 637 נקודות בלבד למרות גודל של מעל 4 מיליארד פרמטרים. המשמעות בפועל היא שבכל מה שקשור לזיהוי אותיות, מספרים וקריאת שלטים, הוא מתפקד מצוין לגודלו.

עם זאת, כשמסתכלים על שאר המדדים התמונה משתנה. בבדיקות כלליות יותר כמו MMBench או AI2D הוא מקבל ציונים נמוכים של 47.7 ו־53.6 בהתאמה, הרבה מאחורי מתחרים עם שני מיליארד פרמטרים. הוא לא מיועד להבנת סצנות מורכבות או הסקת מסקנות ויזואליות עמוקות, אלא בעיקר לעבודה כסורק חכם שמחלץ מידע יבש.

מתאים ל

  • חילוץ נתונים מטפסים וקבלות

    הוא יודע לקרוא ערכים מתוך שדות קבועים ולפלוט אותם ישירות למבנה JSON מסודר באנגלית.

  • המרת טבלאות מקבצי תמונה

    האימון הייעודי מאפשר לו לפרק עמודות ושורות מתמונת טבלה לרשימות ומערכים בלי להסתבך.

  • סריקת נתונים מגרפים פשוטים

    הוא מחלץ שמות צירים ומספרי נקודות מתוך תרשימי עמודות ישר לתוך שדות מוגדרים מראש.

איפה זה נופל

החולשה העיקרית היא הבנה כללית של תמונות שאינן מסמכים. הממוצע הכללי שלו בלוח המבחנים עומד על 43.5 בלבד, והציון שלו במבחן ההזיות עומד על 29.6 נקודות, הנמוך בטבלה. זה אומר שהוא נוטה להמציא פרטים כשהתמונה מורכבת מדי. בנוסף, המודל אומן על אנגלית בלבד. אם תזרקו עליו מסמכים בעברית, קבלות מקומיות או שלטים בארץ, הוא פשוט לא יידע מה לעשות איתם.

אותה משפחה

h2ovl-mississippi יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לפענוח מסמכים וחשבוניות בעברית?

לא. המודל הוגדר ואומן על השפה האנגלית בלבד, ואין לו תמיכה רשמית בעברית. ניסיון להזין לו טקסט מקומי יוביל לתוצאות משובשות והזיות.

האם יש צורך בשרת עם כרטיס מסך חזק כדי להריץ אותו?

ממש לא. כל המודל שוקל 1.5 גיגה בייט בלבד. כל מחשב עם מעבד גרפי פשוט ואפילו חומרת קצה קלה יכולים להריץ אותו מקומית בלי בעיה.

איך מריצים

המשקל הכולל של הקבצים הוא 1.5 גיגה בייט בלבד בדיוק bfloat16, כך שכרטיס מסך בסיסי עם 4 או 6 גיגה זיכרון יריץ אותו בקלות בלי קיצוצים. ההרצה דורשת התקנה של ספריות סטנדרטיות כמו transformers, torch, timm ו־flash_attn, בלי צורך בתשתית שרתים מסובכת.

אם אתם שוקלים להשתמש בגרסת ה־2B של אותה סדרה, היא נותנת קפיצה מסוימת במבחני הבנה כלליים אבל דורשת יותר משאבים. אם כל מה שאתם צריכים זה לחלץ שדות מטפסים, להריץ אותו מקומית על מעבד גרפי פשוט יהיה זול ומהיר יותר משליחת אלפי בקשות ל־API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="h2oai/h2ovl-mississippi-800m")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות משוחררים תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗