GPT
B

BioTrove

קוד פתוח

BGLabmit2024-10-31

  • biology
  • image
  • animals
  • species
  • taxonomy

מאגר ענק של מטא-דאטה לזיהוי מינים ביולוגיים עם קישורים לתמונות וטקסונומיה מלאה. הוא מתאים למי שמאמן מודלי ראייה ממוחשבת וצריך גיוון רחב מעבר לבעלי חיים גדולים ומוכרים.

  • 7,084הורדות בחודש
  • 19לייקים

מה זה

המאגר מכיל מידע על מעל 161.9M תמונות המכסות 366.6K מינים. הרשומות כוללות היררכיה טקסונומית מלאה וכתובות URL להורדת התמונות עצמן, ומחולקות לקבוצות כמו צמחים, חרקים, פטריות, יונקים, זוחלים, עופות ודגים. הדאטה נאסף כדי לייצג מגוון ביולוגי רחב ולא רק מינים פופולריים.

בנוסף לקבצי המידע המרכזיים שמחולקים לאלפי חלקים, החוקרים הוסיפו שלושה סטים ייעודיים להערכת ביצועים. הסט המאוזן כולל כ־112K דגימות, סט המינים הלא-נצפים מכיל כ־11.9K דגימות להערכת הכללה, וסט שלבי החיים מתמקד בחרקים ומכיל 20 תוויות של ביצה, זחל, גולם ובוגר שנאספו מפלטפורמת iNaturalist.

מתאים ל

  • אימון מודלי CLIP לטבע

    אימון וכיול של מודלי ראייה וטקסט על מאגר עצום של מאות אלפי מינים ביולוגיים.

  • מבחני הכללה למינים נדירים

    בדיקת ביצועי מודל על מינים שלא נכללו באימון בעזרת תת המאגר הייעודי.

  • סיווג שלבי התפתחות בחרקים

    הערכת יכולת זיהוי של חרק לאורך מחזור חייו, מביצה וזחל ועד בוגר.

איפה זה נופל

הבעיה המרכזית היא שהקבצים כוללים רק כתובות אינטרנט לתמונות ולא את הקבצים עצמם. קישורים חיצוניים עלולים להישבר, להשתנות או להיעלם עם הזמן, מה שיוצר בעיית שחזור. בנוסף, כל המטא-דאטה והשמות המדעיים מנוהלים באנגלית ובלטינית בלבד, ללא שמות בעברית. לפני שילוב בפיתוח צריך לקחת בחשבון את הזמן, רוחב הפס ומשאבי האחסון הנדרשים להורדת מיליוני תמונות ממקורות חיצוניים.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, המאגר מופץ תחת רישיון MIT שמאפשר שימוש מסחרי, התאמה והפצה. התנאי העיקרי הוא שמירה על הצהרת הרישיון וזכויות היוצרים של היוצרים המקוריים.

האם התמונות עצמן שמורות בתוך הקבצים?

לא, הקבצים כוללים מטא-דאטה טקסונומי וקישורי URL להורדת התמונות ברשת. תצטרכו להוריד את התמונות עצמן באמצעות ספריית הפייתון שהחוקרים פרסמו או בסקריפט עצמאי.

האם המידע כולל תמיכה בשפה העברית?

לא, הנתונים מתועדים באנגלית ובשמות מדעיים בלטינית. אם יש צורך בשמות עבריים של צמחים או בעלי חיים, תצטרכו למפות אותם בעצמכם מול השמות המדעיים.

מה ההבדל בין המאגר המלא לסטים של הבנצ'מרק?

המאגר המלא נועד לאימון רחב היקף עם מעל 161.9M רשומות, בעוד שארבעת קבצי הבנצ'מרק מיועדים למבחנים מבוקרים. הם כוללים סט מאוזן של כ־112K דוגמאות, סט להכללה על מינים שלא נראו, וסט לבדיקת שלבי חיים שונים של חרקים.

איך טוענים

המאגר מורכב מ־3,260 קבצים בפורמטים של CSV ו־Parquet, ללא צורך באישור גישה מיוחד. הוא לא מכיל את התמונות בקבצים עצמם אלא קישורים ברשת, כך שצריך להוריד אותן באופן עצמאי. לצורך עיבוד הנתונים והורדת התמונות, המפתחים מספקים ספריית פייתון בשם arbor-process שזמינה להתקנה מ־PyPI ומטפלת בסינון ובמבנה הטקסונומי.

from datasets import load_dataset

ds = load_dataset("BGLab/BioTrove")

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי והפצה, ללא דרישה לשתף תוצרים באותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, מה שמאפשר לאמן עליו מודלים מסחריים בלי הגבלה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗