GPT
S

SAM3-Demo

רץ בדפדפן

prithivMLmodsapache-2.02025-11-20

  • gradio
  • mcp-server

הכלי מבודד ומסמן אובייקטים בתמונות ובסרטוני וידאו לפי פקודת טקסט או לחיצה בעכבר. הוא מיועד למי שרוצה לבדוק יכולות סגמנטציה מתקדמות ישירות בדפדפן בלי להקים סביבת פיתוח.

  • הורדות בחודש
  • 84לייקים

מה זה

מעלים תמונה או קובץ וידאו בפורמט MP4, ומכוונים את הזיהוי בעזרת תיאור טקסטואלי חופשי באנגלית או בלחיצות ישירות על גבי התמונה. הפלט מתקבל כתמונה מסומנת עם מסכות חיתוך, או כקובץ וידאו מעובד שעוקב אחרי העצם הנבחר לאורך הפריימים.

מאחורי הממשק רצים מודלים ממשפחת facebook/sam3, כולל מודל תמונה, מודל מעקב ייעודי ומודל וידאו שרץ בדיוק של bfloat16. המערכת כוללת דוגמאות מובנות של תמונת שחקן עם הפקודה player in white ודוגמת וידאו עם מעקב אחר players, מה שמראה שהכלי נבדק בעיקר על זיהוי דמויות ואובייקטים בתנועה.

מתאים ל

  • בידוד אובייקטים מתמונות

    חילוץ מסכות סגמנטציה מדויקות של חפצים או אנשים מתמונה לפי מילת תיאור בלבד.

  • מעקב אחר תנועה בווידאו

    סימון ועקיבה רציפה אחרי דמויות או כלי רכב בקטעי וידאו קצרים עד 500 פריימים.

  • סגמנטציה מהירה בלחיצה

    סימון שטחים ואובייקטים מוגדרים בתמונה באמצעות לחיצות עכבר ישירות בלי צורך בניסוח טקסט.

איפה זה נופל

ההדגמה מוגבלת מאוד בווידאו: חיתוך מעל 500 פריימים חסום בממשק, ויש ניתוק כפוי לאחר שלוש דקות לכל היותר. ההנחיות הטקסטואליות דורשות אנגלית, והקוד מראה שהדוגמאות אינן נשמרות במטמון. בנוסף, חומרת שיתוף משאבים עלולה להחזיר שגיאות טעינה של המודל אם הכרטיס הגרפי לא מתפנה בזמן.

שאלות
נפוצות

האם השימוש בהדגמה כרוך בתשלום?

לא, הגישה לממשק דרך הדפדפן היא בחינם ואינה דורשת תשלום. המשאבים מוקצים על גבי תשתית משותפת של Hugging Face.

האם אפשר להריץ את הכלי הזה מקומית?

כן, הקוד מבוסס על ספריות סטנדרטיות ועל המודלים הפתוחים של facebook/sam3, ברישיון apache-2.0. לצורך הרצה עצמאית נדרש מחשב עם כרטיס גרפי תומך ומספיק זיכרון וידאו.

כמה זמן לוקח לעבד וידאו?

זמן העיבוד תלוי באורך הקובץ ובמספר הפריימים שבחרתם, בין 10 ל־500. המערכת כוללת מנגנון שמנתק את הפעולה אם העיבוד חורג מ־60, 120 או 180 שניות לפי בחירתכם.

מה קורה עם התמונות והסרטונים שאני מעלה?

הקבצים נשלחים לעיבוד בשרת המארח של ההדגמה ומעובדים בקבצים זמניים לצורך החישוב. אל תעלו מידע רגיש או קבצים פרטיים לפלטפורמות הדגמה ציבוריות מסוג זה.

איך משתמשים

בוחרים את אחת משלוש הלשוניות: חיתוך תמונה בטקסט, חיתוך וידאו, או חיתוך תמונה בלחיצות. בתמונות מזינים הנחיה או לוחצים על האובייקט, בוחרים סף ביטחון ולוחצים על כפתור העיבוד. בווידאו אפשר להגביל מראש בין 10 ל־500 פריימים ולהגדיר מגבלת זמן של 60 עד 180 שניות כדי למנוע קריסה. ההדגמה רצה על חומרת zero-a10g שמוקצית לפי דרישה, ולכן עיבוד וידאו עשוי לקחת זמן או להמתין להקצאת המשאבים.

הרישיון

הקוד וההדגמה מפורסמים תחת רישיון apache-2.0, שמאפשר שימוש חופשי ושינוי של הקוד. המידע והקבצים שאתם מעלים מועברים ומעובדים בשרתי Hugging Face לצורך הפעלת המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗