GPT
H

h2ovl-mississippi-2b

קוד פתוח

h2oaiapache-2.02024-10-15

  • transformers
  • safetensors
  • h2ovl_chat
  • feature-extraction
  • gpt

יש כאן גם סקירה על H2O AI עצמו.

מודל ראייה ושפה קומפקטי שמביא יכולות פענוח תרשימים וטפסים לחומרה בסיסית. הוא מתאים למי שחייב לעבד מסמכים מקומית ובזול.

  • 2.2Bפרמטרים
  • 4.0 GBמשקל הקבצים
  • 45,552הורדות בחודש
  • 44לייקים

מה זה

מדובר במודל רב-מודאלי קטן שמבוסס על שילוב של מודלי השפה מסדרת Danube יחד עם רכיבי ראייה. הוא אומן על 17 מיליון זוגות של תמונה וטקסט, והמטרה העיקרית שלו היא התמודדות עם תמונות שמכילות נתונים: קריאת מסמכים, חילוץ OCR, הבנת טבלאות וניתוח תרשימים ישירות לתוך פורמטים מובנים כמו JSON.

במבחני הביצועים הוא בולט בעיקר במתמטיקה מבוססת ראייה עם ציון של 56.8 במבחן MathVista, תוצאה שעוקפת מודלים כמו Qwen2-VL-2B ו־Phi-3-Vision. בבדיקות כלליות יותר כמו MMBench ו־MMMU הוא מציג ציונים נמוכים יותר מהמתחרים המובילים בקטגוריה, כך שהחוזק המרכזי שלו מתרכז בעיבוד נתונים מספריים ומובנים מתמונות ולא בידע כללי רחב.

מתאים ל

  • חילוץ JSON מטפסים

    שליפת שדות מטפסים וקבלות ישירות למבנה מוגדר מראש, בזכות אופטימיזציה ייעודית של הנחיות לחילוץ נתונים.

  • המרת טבלאות ותרשימים

    קריאת ערכים מצירים ומגרפים באנגלית לתוך מערכים מספריים, תחום שבו הוא מציג דיוק גבוה יחסית לגודלו.

  • סריקת מסמכים מקומית

    הרצה בארגונים שאינם יכולים להוציא מידע לענן, תוך ניצול דרישות החומרה הנמוכות של מודל שני מיליארד פרמטרים.

איפה זה נופל

המודל הוגדר רשמית עבור השפה האנגלית בלבד, ואין לו הכשרה ייעודית לעברית. מסמכים בעברית או טקסטים מקומיים ייכשלו או ייצרו טעויות פענוח קשות. בנוסף, המפתחים מצהירים במפורש שהוא עלול לייצר תשובות שגויות, הזיות או תוכן מוטה. במבחן Hallusion הוא קיבל ציון של 36.4 בלבד, נתון שמחייב אימות קפדני של הנתונים לפני שמסתמכים על ה־JSON שהוא מחלץ.

אותה משפחה

h2ovl-mississippi יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך במסמכים וחשבוניות בעברית?

לא. המודל מוגדר רשמית לשפה האנגלית בלבד, ולא הוכשר לזהות אותיות או מבנה משפטים בעברית. אם תזינו לו תמונה עם טקסט בעברית, הוא ייכשל בזיהוי או יפלוט שיבושים.

האם הוא מסוגל להחליף מנוע OCR ייעודי?

הוא קיבל ציון של 782 במבחן OCRBench, שזה קרוב למודלים מובילים בגודל הזה, אך הוא מיועד לחילוץ משולב של הבנה ולא רק סריקה עיוורת. למסמכים מורכבים מאוד באנגלית הוא יעבוד טוב, אבל דורש בדיקה מול פתרונות OCR מסורתיים.

מה צריך כדי להרים אותו בסביבת ייצור?

מחשב או שרת עם כרטיס מסך שמכיל לפחות 8 גיגה-בייט VRAM, ספריית vLLM מגרסה 0.6.4 ומעלה, וחיבור דרך ממשק דמוי OpenAI לקבלת תוצאות מהירה.

איך מריצים

המודל שוקל 4.0 גיגה-בייט ומגיע בדיוק bfloat16, מה שאומר שכרטיס מסך בודד עם 8 עד 12 גיגה-בייט של זיכרון VRAM יספיק להרצה מקומית בלי סיבוכים. התמיכה המובנית בספריית vLLM מגרסה 0.6.4 מאפשרת להרים אותו כשרת עצמאי עם ממשק תואם OpenAI, ואפשר להאיץ את הביצועים בעזרת flash-attention אם מריצים על כרטיסי Ampere.

אם אתם צריכים רק בדיקות נקודתיות או קריאות בודדות פעם בכמה שעות, עדיף לפנות ל־API חיצוני של שירות ענן ולחסוך תחזוקת שרת. לעומת זאת, כשיש זרימה קבועה של מסמכים וטפסים שחייבים להישאר בתוך הרשת המקומית, פריסה שלו על שרת פנימי קטן תעבוד חלק ובמחיר חומרה נמוך.

from transformers import pipeline

pipe = pipeline("text-generation", model="h2oai/h2ovl-mississippi-2b")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצרים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗