GPT
S

Seed1.5-VL

רץ בדפדפן

ByteDance-Seedapache-2.02025-05-13

  • gradio

ממשק צ'אט רב מודלי שמנתח תמונות ווידאו לצד טקסט. הוא מתאים למי שרוצה לבדוק יכולות של זיהוי ויזואלי והבנת סצנות בדפדפן.

  • הורדות בחודש
  • 160לייקים

מה זה

מעלים לכאן תמונה, סרטון וידאו או כמה קבצים במקביל, ומצרפים שאלות או הנחיות בטקסט. המערכת מחזירה תשובות בצ'אט ומסוגלת גם לסמן תיבות, נקודות ותוויות ישירות על גבי התמונות באמצעות כלי ציור ייעודי שרץ מאחורי הקלעים. יש בממשק אפשרות לעבוד עם קבצים שמורים או לקלוט תמונות ישירות מהמצלמה המקומית בטאב ייעודי, לצד בורר שפות לאנגלית ולסינית.

מתחת למכסה המנוע רץ המודל Seed1.5-VL שמחובר למנוע היסק ומנתח תוכן ויזואלי יחד עם הנמקה. הדוגמאות המובנות כוללות קובץ וידאו בודד בפורמט MP4, תמונות השוואה בין ערים כמו ניו יורק ובייג'ינג, תמונת חידה, מסמך סרוק ותמונות נוספות ממאגרי מידע מוכרים. דרך הדוגמאות אפשר לראות שהמטרה היא לבחון הבנה מורכבת של פרטים בסרטונים, פתרון חידות ויזואליות וזיהוי אובייקטים.

מתאים ל

  • ניתוח והשוואת תמונות

    מעלים שתי תמונות במקביל ושואלים שאלות על ההבדלים ביניהן, כמו בדוגמה של ניו יורק ובייג'ינג.

  • הבנת סרטוני וידאו

    מזינים קובץ וידאו קצר בפורמט MP4 ומבקשים פירוט על הפעולות שמתרחשות לאורכו.

  • זיהוי וסימון אובייקטים

    מבקשים מהמודל לאתר פריטים בתמונה ולקבל בחזרה תמונה עם תיבות סימון ותוויות.

איפה זה נופל

הבעיה המרכזית היא שההדגמה כלל לא עובדת ברשת כרגע בגלל שגיאת בנייה. מעבר לזה, חומרת מעבד בסיסית לא מתאימה לניתוח שוטף של קובצי וידאו כבדים. אי אפשר ללמוד מהביצועים כאן על המהירות האמיתית של המודל בסביבת ייצור, וממשק המשתמש מוגבל רק לאנגלית ולסינית בלי שום התאמה לימין לשמאל או לעברית.

שאלות
נפוצות

האם הממשק פועל כרגע?

לא, המרחב מדווח כרגע במצב של שגיאת בנייה. הקוד קיים בעמוד אבל הממשק עצמו מושבת ולא מגיב.

האם השימוש כרוך בתשלום?

הגישה לריפו פתוחה וחינמית תחת רישיון חופשי. אין כאן מנגנון תשלום או דרישה לחשבון בתשלום.

אפשר להריץ את המערכת מקומית?

כן, הקוד מבוסס פייתון ורישיון אפאצ'י 2.0 מאפשר להוריד את הקבצים. צריך להגדיר מזהה מודל ולדאוג לחומרה מתאימה להרצה.

כמה זמן לוקח לנתח וידאו בממשק הזה?

הסביבה הזו מוגדרת על מעבד בסיסי בלבד ללא כרטיס גרפי. גם אם המרחב היה עולה, ניתוח וידאו על חומרה כזו היה לוקח דקות ארוכות.

איך משתמשים

נכנסים לממשק ובוחרים בין טאב אופליין להעלאת קבצים לבין טאב אונליין שעובד עם מצלמת רשת. בוחרים שפה, מכניסים מדיה וטקסט, מכוונים את הטמפרטורה או מצב החשיבה, ושולחים. כרגע המרחב נמצא במצב של שגיאת בנייה ולכן אי אפשר להריץ אותו ישירות בדפדפן. בנוסף, הוא מוגדר על מעבד בסיסי בלבד, מה שמבטיח ריצה אטית מאוד אם המרחב יחזור לפעול ללא מאיץ גרפי ייעודי.

הרישיון

הקוד מופץ תחת רישיון apache-2.0 שמתיר שימוש חופשי ושינויים בקוד המקור. לגבי קבצים ותמונות שמועלים לממשק, אין פירוט בתיעוד על מדיניות שמירת הנתונים בסביבת ההדגמה הזאת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗