GPT
B

beans

קוד פתוח

AI-Lab-Makereremit2022-03-02

תמונות של עלי שעועית בריאים וכאלה שחלו במחלות עלים נפוצות, לסיווג ראייה ממוחשבת. הוא ממוקד, קל משקל ומגיע מחולק כבר לאימון, אימות ובדיקה.

  • 6,337הורדות בחודש
  • 47לייקים

מה זה

המאגר מכיל תמונות תקריב של עלי שעועית בגודל 500 על 500 פיקסלים בפורמט צבעוני, שנועדו למשימת סיווג תמונה. כל רשומה כוללת את קובץ התמונה עצמו, נתיב מקומי ותווית מספרית שמשויכת לאחת משלוש קטגוריות: עלי שעועית בריאים, עלים עם כתמי עלים זוויתיים, או עלים הנגועים בחלודה. הנתונים מתועדים באנגלית, כשהתוויות ממופות למספרים מאפס עד שתיים.

החומר מחולק מראש לשלוש קבוצות עבודה מוגדרות היטב. חלק האימון כולל 1,034 תמונות, קבוצת האימות כוללת 133 דוגמאות, ולחלק הבדיקה הסופי הוקצו 128 תמונות. הנתונים הועלו במקור על ידי מעבדת הבינה המלאכותית של אוניברסיטת מקרה בשנת 2020 ומקושרים למאגר שלהם, אך כרטיס המאגר לא מפרט כיצד התמונות נאספו בשטח, אילו מצלמות שימשו לצילום, או מי ביצע ואימת את התיוג של המחלות.

מתאים ל

  • אימון מודל סיווג קל

    בניית מודל לזיהוי שתי מחלות עלים ספציפיות בעלי שעועית או הבחנה בין עלה חולה לבריא.

  • בנצ׳מרק לראייה ממוחשבת

    בדיקת ארכיטקטורות קלות משקל לסיווג תמונות על חלוקות אימון ובדיקה קבועות ומוכנות.

  • פרויקטי הדגמה ולימוד

    הדגמת תהליכי עיבוד תמונה וסיווג חקלאי על דאטהסט קטן שנפתח ונטען במהירות.

איפה זה נופל

הכרטיס ריק מפרטים חיוניים: אין מידע על תנאי התאורה, זני השעועית, המיקום הגיאוגרפי של השדות או אופן אימות התוויות. המאגר כולל שלוש מחלקות בלבד, כך שהוא לא מתאים למערכת שצריכה לזהות מזיקים ומחלות נוספות בשטח. בנוסף, מדובר במאגר קטן יחסית מ־2020 שלא נותן מענה למגוון חקלאי אמיתי בלי בדיקה מעמיקה של התמונות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, המאגר מוגדר תחת רישיון MIT שמאפשר שימוש מסחרי מלא. תוכלו לאמן עליו מודלים ולשלב אותם במוצר עסקי בלי להפיץ את קוד המקור. חובה רק לצרף את תנאי הרישיון המקוריים של המאגר.

האם יש במאגר תמיכה בשפה העברית?

הנתונים הם תמונות של עלים ולא טקסט, כך שאין כאן תוכן בעברית. שמות המחלקות והתיעוד הטכני מופיעים באנגלית בלבד. אם תרצו להציג תוצאות בעברית, תצטרכו לתרגם את שלוש התוויות באופן ידני בממשק שלכם.

איך נאספו התמונות והתוויות?

כרטיס המאגר לא מוסר מידע על תהליך האיסוף או הסינון. הפרטים על הציוד, מקור העלים וזהות המתייגים חסרים בכרטיס. מה שידוע הוא רק שהפרויקט פורסם במקור על ידי מעבדת הבינה המלאכותית מקרה בשנת 2020.

כמה מקום ומשאבים המאגר דורש?

המאגר קטן מאוד וכולל קצת פחות מאלף ושלוש מאות תמונות בסך הכל, ברזולוציה של 500 על 500 פיקסלים. אפשר להוריד ולעבד אותו תוך דקות בודדות על מחשב רגיל בלי צורך בתשתית אחסון מיוחדת. הוא מחולק כבר לקובצי פרקט נוחים לקריאה ישירה.

איך טוענים

טוענים את המאגר ישירות בעזרת שורת פקודה רגילה של ספריית הדאטהסטים לפי המזהה שלו, בלי צורך בבקשת גישה או טופסי אישור. המאגר קטן, מכיל פחות מעשרת אלפים דוגמאות וזמין בקובצי פרקט או ארכיוני זיפ. כשניגשים לנתונים בקוד, עדיף לגשת קודם לאינדקס הדוגמה ורק אז לשדה התמונה כדי למנוע פענוח כבד של כל הקבצים בבת אחת בזיכרון.

from datasets import load_dataset

ds = load_dataset("AI-Lab-Makerere/beans")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הנתונים ואימון מודלים שיימכרו הלאה, ללא חובת שיתוף באותו רישיון. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או בתוכנה שמשתמשת בו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗