GPT
S

SenseNova-Vision-7B-MoT

קוד פתוח

sensenovacc-by-nc-4.02026-06-29

  • multimodal
  • vision-language
  • image-generation
  • image-editing
  • segmentation

במקום להחזיק ראש נפרד לזיהוי אובייקטים, לעומק ולסגמנטציה, מקבלים מודל יחיד שמייצר טקסט, תמונה או שילוב ביניהם. מי שצריך לטפל בכמה משימות ראייה ממוחשבת במקביל ימצא כאן מענה כולל.

  • 27.6 GBמשקל הקבצים
  • 377הורדות בחודש
  • 114לייקים

מה זה

בניגוד למערכות ראייה מסורתיות שמרכיבות ראש ייעודי לכל משימה, כאן הופכים את כל פעולות הראייה ליצירה מולטימודלית. מזינים הוראה בטקסט ולעיתים פרומפט חזותי, והמודל מחזיר קואורדינטות בטקסט למשימות זיהוי ומיקום, או מפות צבע לחישובי עומק, כיווני משטח ומסכות סגמנטציה.

במדדי זיהוי אובייקטים וטקסט כמו COCO ו־ICDAR15 הוא מציג תוצאות טובות יותר מדגמים כלליים מתחרים, אך במשימות מסוימות כמו הבנת ממשקי משתמש ב־ScreenSpot-V2 מודלים אחרים משיגים דיוק גבוה ממנו. הוא שומר על יכולות מולטימודליות כלליות, אך מיועד בעיקר לחישובי גיאומטריה וראייה מובנית.

מתאים ל

  • הערכת עומק וכיוון משטחים

    הוא מחזיר מפות עומק ונורמלים מתוך תמונה בודדת בלי להזדקק למודל ייעודי נפרד.

  • סגמנטציה לפי הוראות טקסט

    יודע לקבל הנחיה מילולית ולייצר מסכת בידוד מדויקת לאובייקט המבוקש.

  • שחזור גיאומטרי מתמונות מרובות

    מייצר ענני נקודות ומחשב זוויות מצלמה מכמה זוויות צילום שונות של אותה סצנה.

איפה זה נופל

המודל לא מנצח מודלים ייעודיים בכל תחום, ובמשימות ספציפיות כמו סגמנטציה פנאופטית הוא מפגר אחרי כלים ממוקדים. מעבר לכך, הפלטים שלו דורשים פענוח מותאם אישית לפי קונבנציות המפתח, כך שהתשובה אינה תמיד מבנה נתונים מיידי. הדיוק המטרי בחישובי עומק ומצלמה אינו מובטח, והמודל רגיש מאוד לניסוח ההוראה ולסגנון הפרומפט שמוזן אליו.

שאלות
נפוצות

האם אפשר להשתמש במודל במוצר מסחרי?

לא, הרישיון שבו המודל שוחרר הוא לשימוש לא מסחרי בלבד. אם המוצר שלכם מיועד למכירה או לשימוש עסקי, תצטרכו לחפש חלופה ברישיון פתוח יותר.

איזה פלט המודל מחזיר בתשובה?

הוא מייצר טקסט עם נקודות ציון למשימות איתור, תמונות מפה למשימות עומק ומסכות, או שילוב של שניהם. לאחר מכן נדרש שימוש בקוד הפענוח של המאגר כדי להמיר את המפות לפורמט הרצוי.

איך מריצים

המודל שוקל 27.6 גיגה-בייט ורץ דרך הריפו הרשמי בגיטהאב באמצעות סקריפטים מובנים וסביבת קונדה ייעודית. כדי להעלות אותו לזיכרון בפורמט המקורי בלי קוונטיזציה תצטרכו כרטיס מסך של לפחות 32 גיגה-בייט זיכרון גרפי, או שני כרטיסים קטנים יותר במקביל.

הריצה המקומית דורשת שימוש בסקריפט מעטפת ומפענחים שממירים את הפלטים חזרה למסכות או לקואורדינטות. אם כל מה שאתם צריכים זו קריאה בסיסית של טקסט או סגמנטציה נקודתית, קריאת API פשוטה מול שירות ענן ייעודי תחסוך לכם תחזוקת תשתית כבדה.

pip install -U huggingface_hub
hf download sensenova/SenseNova-Vision-7B-MoT

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שמותר להשתמש במודל, לשנות אותו ולחקור אותו לצרכים אישיים ומחקריים בלבד. שימוש מסחרי מכל סוג אסור לחלוטין, כך שלא תוכלו לשלב אותו במוצר שמניב הכנסות או בפעילות עסקית שוטפת בלי להסדיר רישוי אחר מול היוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗