GPT
N

Nous-Hermes-2-Vision-Alpha

קוד פתוח

NousResearchapache-2.02023-11-28

  • transformers
  • pytorch
  • llava_mistral
  • text-generation
  • mistral

שילוב בין מודל טקסט מבוסס מיסטרל לראייה ממוחשבת, שמחזיר קריאות לפונקציות ישירות מתמונות. מתאים למי שבונה אוטומציות מבוססות ראייה ולא רוצה להסתמך על ענן סגור.

  • 32,768טוקנים בהקשר
  • 14.3 GBמשקל הקבצים
  • 291הורדות בחודש
  • 305לייקים

מה זה

הבסיס כאן הוא חיבור בין OpenHermes 2.5 המוכר בגודל 7B לבין רכיב ראייה מסוג SigLIP 400M, בתוך ארכיטקטורת LlavaMistral. במקום להשתמש במקודד תמונה כבד של 3B פרמטרים, המפתחים בחרו ברכיב קל יותר שמצמצם את העומס החישובי ומאפשר ריצה נוחה יחסית על חומרה מקומית.

מה שמייחד אותו ממודלי ראייה פתוחים אחרים באותו סדר גודל הוא דאטהסט האימון. הוא אומן על מאות אלפי דוגמאות מ־LVIS, מ־ShareGPT4V ומאגר פרטי של קריאות לפונקציות. המשמעות היא שאפשר להזין תמונה יחד עם סכמת JSON מוגדרת תחת התגית fn_call, ולקבל בחזרה פלט מובנה לפי השדות שביקשתם, כמו חילוץ פריטים מתפריט או זיהוי מאפיינים של עצמים.

מתאים ל

  • חילוץ נתונים מתמונות ל־JSON

    המרת צילומי מסמכים, תפריטים ושלטים למבנה נתונים מוגדר באמצעות סכמת פונקציה ייעודית.

  • בוטים לניתוח ויזואלי

    מענה לשאלות על תוכן של תמונות מורכבות תוך שימוש ביכולות השיחה של בסיס המיסטרל.

  • אוטומציות מבוססות מצלמה

    זיהוי מצבים מוגדרים מראש מתוך תמונה והחזרת ערכים סגורים להמשך טיפול בקוד.

איפה זה נופל

זהו שחרור אלפא, וככזה צריך להתייחס אליו בזהירות. הוא מוגדר רשמית לשפה האנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד תמונות עם טקסט בעברית או להנחיות בשפה המקומית. בנוסף, חילוץ המידע תלוי בהיצמדות לתחביר ה־JSON של המודל, ובגרסאות מוקדמות מסוג זה יש נטייה לפספס שדות מורכבים או להמציא ערכים אם התמונה עמוסה מדי.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל הוגדר ואומן על דאטה באנגלית בלבד. הוא עשוי לזהות מילים בודדות בעברית אם הן ברורות, אבל סביר מאוד שישבש משפטים שלמים או ייכשל בפענוח טקסט עברי מתוך תמונה.

איך מפעילים את מנגנון ה־Function Calling?

עוטפים את הגדרת הסכמה בתוך תגית ייעודית של fn_call בתחילת ההודעה. המודל מזהה את התבנית הזו ומחזיר ישירות את ערכי המאפיינים שביקשתם בפורמט JSON תקין.

מה המשמעות של גרסת האלפא בשימוש בייצור?

גרסת אלפא מעידה על שלב ניסיוני שמיועד בעיקר למפתחים ולבדיקות. ייתכנו חוסר יציבות בהיצמדות לסכמות, הזיות בפרטים קטנים ושינויי ארכיטקטורה בגרסאות הבאות, ולכן לא מומלץ להסתמך עליו למערכות קריטיות בלי מעטפת בדיקות הדוקה.

איך מריצים

המשקל הכולל של הקבצים עומד על 14.3 ג'יגה בייט בדיוק של bfloat16. כדי להריץ אותו מקומית כמו שהוא, בלי קוונטיזציה, תצטרכו כרטיס מסך עם לפחות 16 עד 24 ג'יגה זיכרון גרפי, תלוי באורך הקלט ובגודל התמונה.

הממשק נשען על ספריית transformers ודורש תבנית פרומפט ספציפית מסוג Vicuna V1. אם אין לכם שרת ייעודי או שאתם לא צריכים שחילוץ המידע יישאר מקומית ומאובטח ברשת הפנימית, הפעלת מודל כזה לבד דורשת תחזוקה שלא תמיד משתלמת מול שירותי ענן מוכנים.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Nous-Hermes-2-Vision-Alpha")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache 2.0. הרישיון מאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה חופשית בתוך מוצרים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗