GPT
O

obsidian-3b-multimodal-q6-gguf

קוד פתוח

nistenmit2023-10-29

  • gguf
  • endpoints_compatible

מודל ראייה ושפה קומפקטי שמבוסס על NousResearch Obsidian בכימות Q6. הוא מתאים למי שרוצה להריץ ניתוח תמונות מקומי ישירות דרך llama.cpp בלי שרתים כבדים.

  • 7.9 GBמשקל הקבצים
  • 1,610הורדות בחודש
  • 71לייקים

מה זה

מדובר בהמרה של המודל NousResearch Obsidian-3B-V0.5 לפורמט GGUF ברמת כימות Q6 שביצע nisten. השילוב כולל את משקולות השפה לצד קובץ mmproj שמטפל בהיטל הנתונים הוויזואליים מול רשת הראייה. המטרה כאן היא לתת מענה מולטימודלי בגודל של שלושה מיליארד פרמטרים בלבד, כזה שמבין תמונות ופולט טקסט.

בגודל כזה של 3B קשה לצפות לדיוק עמוק כמו במודלים ענקיים, אבל הכימות ל־Q6 שומר על רוב היכולת המקורית בלי לאבד פרטים קריטיים כמו בכימותים אגרסיביים יותר. המודל נבנה במקור סביב ארכיטקטורת stablelm, מה שהופך אותו לפתרון קל משקל שרץ מקומית ולא תלוי ברשת חיצונית.

מתאים ל

  • תיאור תמונות אופליין

    מאפשר לייצר תיאור טקסטואלי לתמונה ישירות במכשיר מקומי, בלי לשלוח שום קובץ לשרת חיצוני.

  • סיווג תמונות מהיר

    משקל קל שמאפשר לזהות אובייקטים בסיסיים בתמונות בלי להעמיס על מעבדים יקרים.

  • פיתוח ובדיקות על לפטופ

    רץ ישירות על מעבדי מחשבים ניידים ללא צורך בחומרת שרתים ייעודית לצורך ניסויים מולטימודליים.

איפה זה נופל

מודל מולטימודלי של 3B סובל מהזיות לעיתים קרובות, במיוחד כשדורשים ממנו פירוט טכני או קריאת טקסט זעיר בתוך תמונה. ההרצה תלויה בענף גיטהאב ספציפי של llama.cpp ולא בגרסה הראשית, מה שיכול להקשות על תחזוקה. בנוסף, אין בכרטיס שום מידע על תמיכה בעברית, ולכן צריך לבדוק אותו ביסודיות לפני שמתכננים עליו לממשק מקומי.

שאלות
נפוצות

למה יש שני קבצים שונים להורדה?

הקובץ הראשון מכיל את מודל השפה בכימות Q6, והשני הוא מודל הראייה mmproj שנשאר בפורמט F16. llama.cpp צריך את שניהם יחד כדי לתרגם את המידע החזותי של התמונה לטקסט.

האם אפשר להריץ אותו עם הגרסה הרשמית של llama.cpp?

לפי ההנחיות של המפרסם יש להשתמש בענף stablelm-support ממאגר ייעודי בגיטהאב כדי לקבל תמיכה מלאה בארכיטקטורה. הרצה על גרסה רשמית רגילה עלולה להיכשל אם התמיכה בארכיטקטורה זו לא מוזגה.

איך מריצים

ההרצה נעשית ישירות דרך llama.cpp בעזרת ענף ייעודי שתומך ב־stablelm. צריך לקמפל את הפרויקט, להוריד את שני הקבצים, obsidian-q6.gguf ו־mmproj-obsidian-f16.gguf, ולהרים את השרת המובנה עם פקודה אחת שטוענת 42 שכבות לכרטיס המסך.

הקבצים שוקלים יחד כמעט 8 גיגה בייט, כך שצריך כרטיס מסך פשוט או מחשב מק עם זיכרון מאוחד כדי להריץ הכל בזיכרון המהיר. אם אתם צריכים רק מדי פעם לפענח תמונה בודדת או שאין לכם כוח להתעסק בקימפול מקומי, פנייה ל־API ענן תהיה פשוטה בהרבה.

ollama run hf.co/nisten/obsidian-3b-multimodal-q6-gguf:Q6

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 7.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא MIT. מותר להשתמש בו לצרכים פרטיים ומסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗