GPT
L

LocateAnything

רץ בדפדפן

nvidiaרישיון לא דווח2026-03-18

  • gradio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

העלאת תמונה או וידאו מאפשרת למצוא ולסמן בתוכם כל אובייקט לפי תיאור טקסטואלי חופשי. הכלי מתאים למי שרוצה לבדוק זיהוי אובייקטים מבוסס ראייה ממוחשבת ישירות מהדפדפן.

  • הורדות בחודש
  • 482לייקים

מה זה

אתם מעלים קובץ תמונה או וידאו, מקלידים תיאור קצר של מה שאתם מחפשים באנגלית, והמערכת מסמנת את המיקום המדויק של כל המופעים. הממשק נשען על המודל nvidia/LocateAnything-3B, שמשלב עיבוד שפה טבעית עם ראייה ממוחשבת כדי לתרגם פקודות כמו איתור כל המופעים שתואמים לתיאור מסוים לתיחום ויזואלי על גבי הפריימים.

הקוד שמתחת לוקח את הטקסט שלכם, עוטף אותו בהנחיה מובנית לאיתור אובייקטים או אזורים, ומעביר אותו למודל יחד עם הקבצים. ספריית OpenCV והכלים של PIL מטפלים בפירוק הווידאו ובציור המלבנים והסימונים על גבי התוצאה הסופית שמוצגת לכם בחזרה.

מתאים ל

  • איתור עצמים בתמונות

    מעלים תצלום ומקבלים סימון מדויק של כל האובייקטים שתואמים לתיאור מילולי חופשי.

  • מעקב אחר פריטים בווידאו

    מזינים קובץ וידאו קצר כדי לסמן תנועה או נוכחות של עצמים ספציפיים לאורך הפריימים.

  • בדיקת ביצועי מודל 3B

    בוחנים את יכולות ההבנה והדיוק של המודל הקומפקטי של אנבידיה לפני שמורידים אותו לעבודה מקומית.

איפה זה נופל

הקוד מגדיר מראש תבניות הנחיה באנגלית בלבד, כך שחיפוש בעברית כנראה לא יניב תוצאות טובות אם בכלל. בנוסף, מדובר במודל של שלושה מיליארד פרמטרים שרץ על חומרת שיתוף, ולכן סרטוני וידאו ארוכים או קבצים כבדים עלולים להיתקע, להיחתך או לגרום לשגיאות זיכרון לפני סיום העיבוד.

שאלות
נפוצות

האם השימוש בהדגמה כרוך בתשלום?

לא, הגישה דרך הדפדפן פתוחה בחינם ללא עלות. אין צורך בהזנת פרטי תשלום כדי להעלות קבצים ולהריץ בדיקות.

מה קורה לקבצים שאני מעלה?

הקוד כולל שימוש ברכיב ייעודי ששומר לוגים לדאטהסט נפרד. המשמעות היא שהתמונות, הסרטונים והטקסטים שאתם מזינים מתועדים, ולכן עדיף לא להעלות מידע רגיש או פרטי.

האם אפשר להריץ את הכלי על המחשב שלי?

כן, המודל nvidia/LocateAnything-3B זמין דרך Hugging Face ומבוסס על Transformers סטנדרטי. כדי להריץ אותו מקומית תצטרכו כרטיס מסך מתאים וסביבת פייתון תואמת.

במה שונה הממשק מהמודל עצמו?

הממשק מחבר את המודל לתבניות טקסט קבועות מראש ולעיבוד גרפי של קווי סימון על גבי המדיה. המודל עצמו פולט רק את המיקומים והקואורדינטות, בעוד שכאן מקבלים תוצאה ויזואלית מוכנה בלי לכתוב קוד.

איך משתמשים

גוררים תמונה או סרטון לתוך ממשק ה־Gradio, כותבים את שם הפריט או התיאור שלו, ולוחצים על כפתור ההרצה. ההדגמה רצה על גבי מעבד גרפי מסוג zero-a10g של Hugging Face. זה אומר שהחומרה מוקצית לפי דרישה. ברגע שהמשימה מתחילה, העיבוד עצמו מהיר יחסית בזכות גודל המודל, אבל אם יש עומס שרתים תיתקלו בהמתנה קצרה בתור.

הרישיון

הרישיון של היישום לא דווח בעמוד שלו. כשאין רישיון מוגדר, אסור להניח שמותר להשתמש בפלט או בקוד לצרכים מסחריים. שימו לב שהקוד כולל שמירת לוגים לדאטהסט חיצוני, כך שכל קובץ שאתם מעלים עשוי להישמר בשרתים ולא להישאר פרטי.

הרישיון המלא ב־Hugging Face ↗