GPT
F

florence-sam

רץ בדפדפן

SkalskiPapache-2.02024-08-01

  • gradio

הדגמה שמחברת זיהוי טקסטואלי של עצמים לחיתוך מסכות מדויק בתמונות ובסרטונים. היא מתאימה למפתחים שרוצים לבדוק שילוב מודלים של ראייה ממוחשבת בלי להרים שרת.

  • הורדות בחודש
  • 519לייקים

מה זה

אתם מעלים תמונה או סרטון, בוחרים מצב עבודה ומקלידים מה לחפש, כמו רשימת עצמים מופרדת בפסיקים. הפלט מחזיר את המדיה עם מסכות צבעוניות מסביב לכל עצם שזוהה, לצד פלט טקסטואלי של התיאור. יש בממשק גם מצב של תיאור אוטומטי שגוזר מסכות לבד בלי שתצטרכו להגדיר מראש מה לחפש.

מאחורי הקלעים הקוד משלב את Florence-2-base של מיקרוסופט לצד SAM 2, עם תלות נוספת במודל phi-1_5. פלורנס מזהה את העצמים לפי הטקסט, וסאם מקבל את התיחום הראשוני ומייצר את המסכה המדויקת ברמת הפיקסל. בעיבוד וידאו, המודל עוקב אחרי המסכות לאורך הפריימים באמצעות מנגנון הווידאו של SAM 2.

הדוגמאות המובנות כוללות תמונות של כלבים עם בקשות למציאת קש, מפיות או זנב. הן מדגימות בעיקר זיהוי עצמים יומיומיים באנגלית בתוך פריים בודד.

מתאים ל

  • סגמנטציה מהירה מתיוג טקסט

    מזינים תמונה ושמות עצמים באנגלית, ומקבלים מסכות חיתוך מדויקות בלי לסמן נקודות ידנית.

  • מעקב אחר אובייקט בווידאו

    מעלים קטע קצר ומגדירים עצם, והמערכת מסמנת אותו ועוקבת אחריו לאורך כל הפריימים.

  • יצירת מסכות ללא הנחיה

    מצב התיאור האוטומטי מוצא לבד את האלמנטים המרכזיים בתמונה ומייצר להם שכבות בידוד.

איפה זה נופל

ההדגמה הזו מבוססת על מודל הבסיס הקטן יותר של פלורנס, כך שרמת הדיוק בהבנת סצנות מורכבות נמוכה מזו של הגרסאות הגדולות. הטקסט חייב להיכתב באנגלית, אין כאן תמיכה בעברית לחיפוש עצמים. בנוסף, בסרטונים ארוכים עיבוד הווידאו עלול להיכשל או להיתקע בגלל מגבלות זיכרון וזמן ריצה של חומרת ההדגמה.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה בדפדפן פתוחה וחינמית לחלוטין. היא רצה על משאבי ענן שמוקצים לזמן קצר, בלי צורך במנוי או בהזנת אמצעי תשלום.

האם אפשר להריץ את זה מקומית על המחשב?

כן, הקוד פתוח ברישיון אפאצ'י 2.0 ומבוסס על ספריות סטנדרטיות כמו gradio ו־supervision. תצטרכו כרטיס מסך מתאים עם זיכרון מספק כדי להחזיק את שני המודלים במקביל.

במה זה שונה מהרצת SAM 2 לבד?

סאם דורש בדרך כלל לחיצה על נקודה או סימון קופסה ידנית כדי לדעת מה לחתוך. השילוב עם פלורנס מחליף את הלחיצה הידנית בפקודת טקסט, כך שהזיהוי והחיתוך נעשים ברצף.

כמה זמן לוקח לעבד סרטון?

זה תלוי באורך הקובץ וברזולוציה שלו. תמונות סטטיות מעובדות תוך שניות בודדות, אבל סרטון דורש חיתוך ומעקב בכל פריים בנפרד, כך שהתהליך עשוי לקחת חצי דקה ויותר.

איך משתמשים

הממשק מחולק לשתי לשוניות פשוטות, תמונה ווידאו. גוררים קובץ פנימה, כותבים הנחיה טקסטואלית באנגלית ולוחצים על כפתור השליחה. בצד רץ כרטיס A10G שמוקצה לפי דרישה דרך תשתית ZeroGPU, מה שאומר שהעיבוד עצמו מהיר ברגע שהוא מתחיל. מצד שני, אם יש עומס תצטרכו להמתין להקצאת חומרה לפני שהחישוב ירוץ, ובסרטונים מופיע מד התקדמות כי המעקב אחרי פריימים לוקח יותר מכמה שניות בודדות.

הרישיון

הקוד והחלל מפורסמים תחת רישיון apache-2.0 שמאפשר שימוש חופשי, כולל מסחרי ושינוי קוד. הקבצים שאתם מעלים נשלחים לשרת לצורך העיבוד, ואין מידע על שמירה ארוכת טווח מעבר למחיקה של תיקיות זמניות לפי הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗