GPT
V

ViTPose-transformers

רץ בדפדפן

hystsרישיון לא דווח2025-01-09

  • gradio
  • mcp-server

הדגמה שמזהה אנשים בתמונות או סרטונים ומסמנת עליהם שלד מפרקים. היא מיועדת למי שרוצה לבחון זיהוי תנוחה מבוסס שנאים בלי להגדיר סביבת פיתוח.

  • הורדות בחודש
  • 237לייקים

מה זה

אתם מעלים תמונה או קובץ וידאו, ובוחרים אם להציג תוויות של המפרקים או נקודות חיבור בלבד, לצד סליידר שקובע את סף הביטחון של הזיהוי. הפלט מחזיר תמונה או סרטון עם שלד צבעוני שמולבש על הגוף, ובתמונות מקבלים בנוסף מבנה JSON עם הקואורדינטות המדויקות של כל נקודה.

מאחורי הקלעים רץ שילוב של שני מודלים שונים. תחילה RT-DETR מאתר איפה יש אנשים בפריים ותוחם אותם בקופסה, ומיד אחריו ViTPose מנתח כל אדם שנתפס ומחלץ את נקודות המפתח של הגוף. בממשק משולבות דוגמאות מוכנות מראש של תמונות jpg וסרטוני mp4 שמאפשרות לראות את התוצאה מיד בלי להעלות קבצים מהמחשב.

מתאים ל

  • בדיקת איכות לזיהוי תנוחה

    מעלים תמונות מאתגרות כדי לראות אם המודל מזהה מפרקים טוב יותר מפתרונות קיימים.

  • חילוץ קואורדינטות שלד

    מזינים תמונה ומעתיקים את פלט ה־JSON לשימוש בניתוח תנועה חיצוני.

  • בדיקת עקיבה בווידאו קצר

    בוחנים יציבות של נקודות מפרק לאורך רצף תנועה בקליפ קצר.

איפה זה נופל

אם המודל הראשון לא מזהה אדם בגלל זווית קשה או תאורה חלשה, ViTPose בכלל לא ינסה לחפש שלד. בווידאו יש מגבלה מפורשת שמקצרת קבצים ארוכים למספר פריימים מקסימלי, כך שאי אפשר לזרוק פנימה סרט מלא ולצפות לניתוח רציף. בנוסף, אין כאן אפשרות להוריד קובץ JSON מהווידאו אלא רק לצפות בתוצאה המרונדרת.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, השימוש בדפדפן פתוח לחלוטין וללא תשלום. המשאבים מוקצים על גבי תשתית שיתופית ללא צורך בהזנת פרטי אשראי. כל מה שצריך זה לפתוח את העמוד ולהעלות קובץ.

מה קורה לקבצים שאני מעלה?

התמונות והסרטונים נשלחים לשרת לצורך העיבוד הגרפי בלבד. הקוד משתמש בקבצים זמניים לצורך החישוב והצגת התוצאה בממשק. למרות זאת, מאחר שמדובר בסביבה ציבורית, עדיף לא להעלות חומרים פרטיים או מזהים.

כמה זמן לוקח לקבל תוצאה?

תמונה בודדת מעובדת בדרך כלל תוך שניות בודדות תודות למאיץ הגרפי. בסרטונים התהליך לוקח יותר זמן כי יש צורך לנתח כל פריים, ומוצג פס התקדמות שמראה את הקצב. אם השרת עמוס, תיתכן המתנה קצרה בתור לפני תחילת הריצה.

האם אפשר להריץ את זה מקומית?

כן, הקוד מבוסס על ספריות סטנדרטיות וכולל קישור למחברת קולאב תואמת. אפשר למשוך את המשקולות של שני המודלים ישירות דרך ספריית transformers ולהריץ אותם על מחשב עם מעבד גרפי מתאים. הממשק עצמו נשען על קוד פייתון קצר ב־Gradio.

במה ההדגמה שונה משימוש ישיר במודל?

ההדגמה מחברת אוטומטית בין מודל זיהוי אובייקטים למודל שלד, ומציירת את הקווים על התמונה בלי שתצטרכו לכתוב קוד תצוגה. שימוש ישיר במודל ViTPose דורש מכם לספק מראש את מיקום האדם בפריים, בעוד שכאן הצינור כולו מחובר ומוכן לבדיקה מהירה.

איך משתמשים

גוררים תמונה או וידאו לטאב המתאים, מכוונים את סף הזיהוי ולוחצים על כפתור ההרצה. מאחר שהמערכת יושבת על מעבד גרפי ייעודי מסוג A10G דרך מנגנון ZeroGPU, העיבוד עצמו מתחיל מהר מאוד, אם כי בסרטונים יש פס התקדמות כי העסק דורש מעבר פריים אחרי פריים. אין צורך לפתוח חשבון או להירשם כדי להשתמש בה.

הרישיון

היוצר לא הגדיר רישיון קוד בעמוד. המשמעות היא שאין הרשאה ברורה לקחת את הקוד ולהשתמש בו בפרויקט מסחרי, גם אם המודלים עצמם פתוחים ב־Hugging Face. לגבי הקבצים שאתם מעלים, הם עוברים עיבוד בשרת המארח ולא כדאי להזין לשם חומר רגיש.

הרישיון המלא ב־Hugging Face ↗