GPT
Y

yoloe

קוד פתוח

jameslahmagpl-3.02025-03-10

  • ultralytics
  • object-detection

זיהוי וסגמנטציה של עצמים בעולם פתוח לפי טקסט, תמונה או בלי הנחיה בכלל. מתאים למי שרוצה מהירות של YOLO בלי להיות מוגבל לרשימת קטגוריות סגורה מראש.

  • 1.2 GBמשקל הקבצים
  • 5,477הורדות בחודש
  • 44לייקים

מה זה

הארכיטקטורה כאן מחברת בין מהירות עבודה גבוהה לבין היכולת למצוא עצמים שלא הוגדרו מראש באימון סגור. הבסיס נשען על ultralytics בגרסאות v8 ו־11, עם תוספות של התאמת אזור לטקסט וקידוד הנחיות חזותיות. אפשר להעביר לו שמות של פריטים באנגלית, לסמן אזור בתמונה כדוגמה, או לתת לו לרוץ חופשי ולזהות הכל לבד בעזרת אוצר מילים פנימי.

התוצאות על LVIS מראות את הפואנטה של המבנה הזה. דגם v8-S מגיע לקצב של מעל שלוש מאות פריימים לשנייה על כרטיס T4 עם TensorRT בהנחיית טקסט, ומשיג 27.9 AP. כשעוברים לדגמים הגדולים יותר כמו v8-L הדיוק עולה ל־35.9 AP, אבל הקצב יורד לאזור המאה פריימים לשנייה. הנקודה החזקה היא שבסיום אפשר לבצע לו רה-פרמטריזציה ישירות למבנה YOLO רגיל, וכך להריץ אותו בלי שום תקורת חישוב נוספת.

מתאים ל

  • סימון עצמים בווידאו חי

    קצב של שלוש מאות פריימים לשנייה בדגמים הקטנים מתאים לפעולה בזמן אמת ממצלמות אבטחה או רחפנים.

  • חיפוש חופשי לפי תמונה

    מנגנון SAVPE מאפשר להזין דוגמה ויזואלית ולחפש עצמים דומים בפריים בלי תלות במילות חיפוש מוגדרות מראש.

  • אימון מהיר על נתונים חדשים

    התאמת המודל מחדש לדאטה ייעודי דורשת מעט אפוקים וזמן אימון קצר משמעותית ביחס ל־YOLO סגור מהקופסה.

איפה זה נופל

הדיוק בסגמנטציה רחוק מלהיות מושלם. בבדיקות על LVIS המודלים הגדולים מגיעים ל־23.5 AP בלבד במסיכות, והקטנים נעצרים סביב 17.7 AP. מסיכות עדינות או עצמים מורכבים ידרשו בדיקה ידנית מעמיקה לפני שמסתמכים עליהם בייצור.

מעבר לזה, במצב חופשי ללא הנחיה הקצב נחתך בחצי עד שני שליש בהשוואה לעבודה עם טקסט, ובדגם v8-L הוא צונח ל־25 פריימים לשנייה על T4. בנוסף, המפתחים מציינים שבמקרים של הנחיה ויזואלית שצוירה ידנית צריך להוריד ידנית את סף הביטחון כדי שהעצמים יזוהו.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה באפליקציה מסחרית קניינית?

לא בלי לחשוף את הקוד שלכם. רישיון AGPL-3.0 תופס גם על גישה דרך שרת ומחייב אתכם לשחרר את המוצר כולו תחת אותו רישיון פתוח. למוצרים סגורים תצטרכו לבקש רישוי מסחרי נפרד מהיוצרים.

מה ההבדל המשמעותי בין גרסאות v8 לגרסאות 11?

ההבדלים בביצועים ובדיוק קטנים למדי, כאשר גרסאות 11 מעט קלות יותר במספר הפרמטרים בדגמי ה־S וה־M. דגם 11-S כולל 10 מיליון פרמטרים לעומת 12 מיליון ב־v8-S, אך נותן דיוק וקצב ריצה דומים כמעט לחלוטין על חומרת בדיקה סטנדרטית.

איך מייצאים את הדגם למכשיר קצה?

בגלל שהארכיטקטורה מבצעת רה-פרמטריזציה למבנה YOLO סטנדרטי, מריצים את export.py וממירים לקובץ ONNX או CoreML. משם מטמיעים אותו ישירות ביישום מובייל או מערכת משובצת בלי רכיבי שפה נלווים.

איך מריצים

משקל כל קובץ משקלים בודד נע בין מגה-בייטים בודדים לעשרות מגה-בייטים, כשסך כל הקבצים במאגר תופס 1.2 גיגה-בייט. דגמי ה־S וה־M בעלי 10 עד 30 מיליון פרמטרים, מה שאומר שהם רצים בלי בעיה על מחשב נייד עם מעבד סביר, כרטיס מסך בסיסי או מכשירי קצה. המדידות של המפתחים מראות פעולה חלקה על מעבדי מובייל כמו שבב של אייפון 12 באמצעות CoreML.

אם אתם צריכים רק את דגם v8-S או 11-S, הרצה מקומית על שרת ענן פשוט או חומרה מקומית תעבוד מצוין ותחסוך עלויות תעבורה וזמני השהיה של רשת. שירות חיצוני שווה לשקול רק אם אין לכם תשתית פייתון תומכת או כשרוצים לבדוק ביצועים ראשוניים דרך Gradio.

pip install -U huggingface_hub
hf download jameslahm/yoloe

הרישיון

הפרויקט מופץ תחת רישיון AGPL-3.0. מדובר ברישיון קוד פתוח מגביל במיוחד שמחייב שיתוף קוד מלא. אם אתם משלבים את המודל בשירות שנגיש דרך הרשת, אפילו מאחורי שרת וממשק API, אתם מחויבים לחשוף את כל קוד המקור של המוצר שלכם תחת אותו הרישיון בדיוק.

הרישיון המלא בעמוד המודל ↗