GPT
O

Obsidian-3B-V0.5

קוד פתוח

NousResearchcc-by-sa-4.02023-10-24

  • transformers
  • pytorch
  • llava_stablelm_epoch
  • text-generation
  • Multimodal

מודל ראייה ושפה קומפקטי שמביא יכולות מולטימודליות לחומרה ביתית. הוא מבוסס על שלד של שלושה מיליארד פרמטרים ומיועד למי שצריך עיבוד תמונה וטקסט בלי לפתוח שרתים כבדים.

  • 4,096טוקנים בהקשר
  • 5.8 GBמשקל הקבצים
  • 142הורדות בחודש
  • 184לייקים

מה זה

מדובר במודל שמחבר בין יכולות שפה להבנת תמונה בגודל של שלושה מיליארד פרמטרים, קטגוריה שעד פרסומו כמעט לא הציעה פתרונות ראייה. הבסיס הטקסטואלי שלו נשען על Capybara-3B-V1.9, שמבוסס בעצמו על המודל של סטאביליטי, ועובר תהליך אימון לפי המתכון של LLaVA 1.5. השילוב הזה נועד לייצר מודל קל שמסוגל לענות על שאלות לגבי תמונות בלי המשקל העודף של גרסאות שבעה מיליארד פרמטרים.

היוצרים טוענים שבסיס הטקסט של המודל עוקף מודלים אחרים באותו סדר גודל ואף מנצח חלק ממודלי שבעה מיליארד, אבל כרטיס המודל לא מציג תוצאות מדידה ממוספרות ליכולות הראייה עצמן. במקום מבחנים מסודרים הם השאירו הבטחה לפרסם נתונים בהמשך, כך שצריך לקחת את הצהרות הביצועים בזהירות ולבדוק אותו ישירות על המשימות שלכם.

מתאים ל

  • ניתוח תמונות על חומרה חלשה

    הוא שוקל פחות משישה גיגהבייט ורץ בקלות על כרטיסי מסך ביתיים עם זיכרון נמוך.

  • תיאור תמונות ושאילתות פשוטות

    הוא מבין שאלות על קבצי מדיה באנגלית במבנה שיחה סטנדרטי של LLaVA.

  • אימון ייעודי למשימות ראייה

    קוד האימון פתוח בגיטהאב ומאפשר לבצע התאמה אישית למשימות צרות בלי תקציב ענק.

איפה זה נופל

הבעיה הבולטת ביותר היא היעדר מוחלט של מבחני ביצועים מתועדים עבור יכולות הראייה בכרטיס המודל. אין שום נתון רשמי שמראה עד כמה הוא מדויק בזיהוי פרטים מורכבים או בטקסטים מתוך תמונה. בנוסף, המודל אומן על אנגלית בלבד, וחלון ההקשר עומד על 4,096 טוקנים בלבד, כך שלא תוכלו להעמיס עליו היסטוריית שיחה ארוכה לצד תמונות מרובות.

שאלות
נפוצות

האם המודל מבין פקודות או תמונות עם טקסט בעברית?

המודל הוגדר ואומן עבור השפה האנגלית בלבד. הוא לא מיועד להבנת עברית, וסביר להניח שייכשל בעיבוד טקסט ישראלי מתוך תמונות או בשיחה חופשית.

איזה פורמט קלט צריך לשלוח אליו בשיחה?

הוא עובד במבנה ChatML עם שינוי קל. יש להפריד בין תורות השיחה ברצף של שלושה סולמיות, לצד תגית תמונה מפורשת בתוך הודעת המשתמש כפי שמודגם בתיעוד.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך צנוע יחסית. קבצי המשקלים תופסים כמעט שישה גיגהבייט בדיוק של שש עשרה ביט, כך שכרטיס מסך עם שמונה גיגהבייט זיכרון יספיק כדי לטעון אותו ולבצע הסקת מסקנות בלי להסתבך. הקוד להרצה ולאימון נוסף יושב במאגר הגיטהאב של הפרויקט, והארכיטקטורה משתמשת בספריית transformers הרגילה.

אם כל מה שאתם צריכים זה ניתוח תמונות מזדמן בלי דרישות פרטיות מקומיות, עדיף לפנות ל־API חיצוני של מודל גדול ומבוסס. פריסה עצמית של המודל הזה משתלמת רק כשרוצים שליטה מלאה בתשתית, עבודה מנותקת מרשת, או אפשרות לאמן אותו הלאה על נתונים משלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Obsidian-3B-V0.5")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון cc-by-sa-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, אבל מחייב אתכם לתת קרדיט ליוצרים המקוריים ולשתף כל נגזרת או שינוי שתעשו במודל תחת אותו רישיון בדיוק. למוצר סגור שרוצה לשמור קוד או משקלים לעצמו, מדובר במלכודת שיתוף.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗