GPT
T

TreeOfLife-10M

קוד פתוח

imageomicsרישיון לא דווח2024-01-23

  • biology
  • images
  • animals
  • evolutionary biology
  • CV

המאגר כולל מעל 10 מיליון תמונות ביולוגיות שמכסות 454 אלף טקסונים, עם תיוג היררכי מלא מהממלכה ועד המין. הוא נבנה במיוחד כדי לאמן מודלים רב-מודאליים שמבינים את עולם החי והצומח לעומק.

  • 2,785הורדות בחודש
  • 50לייקים

מה זה

הנתונים מורכבים מתמונות של אורגניזמים חיים וצמודים להם קובצי טקסט עם שמות מדעיים בלטינית ושמות עממיים באנגלית. כמעט 8.5 מיליון תמונות כוללות את מלוא השרשרת הטקסונומית הלינאית, משלב הממלכה ועד המין הספציפי. המקור המרכזי שמאוחסן כאן ישירות מגיע מ־Encyclopedia of Life, שממנו נאספו 6.6 מיליון תמונות לאחר תהליך התאמת שמות מול מאגר ITIS.

שאר הדאטהסט נשען על שני מקורות קיימים שלא כולם יושבים פיזית בתיקייה הזו. כמיליון תמונות חרקים בתנאי מעבדה מגיעות מ־BIOSCAN-1M, ועוד 2.7 מיליון תמונות מהטבע מבוססות על iNat21. החלוקה הפנימית מוגדרת בקובץ הקטלוג לפי קבוצות אימון ואימות, לצד תת קבוצה של מיליון תמונות שנועדה לבדיקות ומחקרי אבלציה.

מתאים ל

  • אימון מודלי ראייה ביולוגיים

    אימון מודלים מבוססי ראייה וטקסט לזיהוי היררכי של מאות אלפי מינים בטבע.

  • סיווג Zero-Shot לטקסונומיה

    בדיקת יכולת הכללה וסיווג תמונות של אורגניזמים ללא דוגמאות מוקדמות.

  • הערכת מודלים על חרקים

    מבחן ביצועים על מיליון תמונות מעבדה מדויקות מתוך BIOSCAN-1M.

איפה זה נופל

יש במאגר חוסר איזון ביולוגי כבד, עם ייצוג עודף למערכות פרוקי-רגליים, בעלי חוליות וצמחים וסקולריים על חשבון ענפים אחרים. עשרה אחוזים מהתמונות, בייחוד אלו שמקורן ב־BIOSCAN-1M, מתויגות רק עד רמת המשפחה ולא מגיעות לזיהוי המין. שמות המינים מופיעים בלטינית ושמות עממיים באנגלית בלבד, ללא שפות נוספות. היוצרים מציינים שבין 0.1 ל־0.2 אחוזים מהרשומות סובלות מטעויות שיוך ברמות הגבוהות בגלל כפילויות שמות במקורות השונים.

אותה משפחה

TreeOfLife יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

אין למאגר רישיון אחיד שמתיר שימוש כזה. כל תמונה נאספה ממקור אחר, וחלקן מוגנות בזכויות יוצרים או ברישיונות מגבילים שמפורטים בקובץ licenses.csv. שימוש מסחרי מחייב סינון של התמונות לפי הרישיון האישי שלהן.

כמה מקום בדיסק צריך כדי לעבוד איתו?

החלק של EOL לבדו מחולק ל־63 קבצים של כ־30 ג'יגה-בייט כל אחד, כלומר קרוב ל־1.9 טרה-בייט לפני פריסה. בנוסף נדרש מקום להורדת iNat21 ולעיבוד קובצי ה־WebDataset הסופיים. מדובר בעבודה שמחייבת אחסון מהיר בנפח של כמה טרה-בייט.

האם יש במאגר שמות בעברית למינים השונים?

אין בעברית שום מידע בדאטהסט. הטקסטים מוגבלים לשמות מדעיים בלטינית ושמות עממיים באנגלית בלבד. אם המוצר שלכם צריך ממשק עברי, תצטרכו למפות את השמות המדעיים למאגרי תרגום חיצוניים.

מה ההבדל בין המאגר הזה לבין iNat21 המקורי?

המאגר מרחיב את 10 אלף המינים של iNat21 לכדי 454 אלף טקסונים שונים, בעיקר בזכות תוספת של 6.6 מיליון תמונות מ־EOL. בנוסף, הוא כולל תמונות מעבדה של חרקים מ־BIOSCAN-1M ומספק ייצוגי אמבדינג מוכנים מראש שנבנו עבור מודל BioCLIP.

איך טוענים

לא מורידים את המאגר הזה בלחיצת כפתור פשוטה של ספריית datasets. המאגר מכיל 63 קובצי ארכיון מכווצים של כ־30 ג'יגה-בייט כל אחד מתמונות EOL, וזה רק חלק מהחומר. תמונות iNat21 אינן מופצות כאן ישירות עקב תנאי השימוש שלהן, ואתם נדרשים להוריד אותן בעצמכם ולהריץ סקריפטים חיצוניים מגיטהאב כדי להרכיב את הפורמט הסופי. קובץ המטא-דאטה המרכזי catalog.csv מחבר בין המזהים הייחודיים, קבוצות האימון, והרמות הטקסונומיות.

from datasets import load_dataset

ds = load_dataset("imageomics/TreeOfLife-10M")

הרישיון

המאגר עצמו פורסם ללא הגדרת רישיון כוללת ברמת הדאטהסט, מה שיוצר בעיה משפטית ישירה לכל שימוש מסחרי. במקום רישיון אחיד, קיים קובץ בשם licenses.csv שמפרט את הרישיון הפרטני של כל תמונה שמקורה ב־EOL, כמו cc-by או זכויות יוצרים של צלמים שונים. בנוסף, חלקי הדאטה שנלקחו מ־iNat21 כפופים למגבלות הנפרדות של אותו פרויקט. אי אפשר לאמן על זה מודל מסחרי בלי לסנן ולבדוק מראש כל קובץ בנפרד.

הרישיון המלא ב־Hugging Face ↗