GPT
T

TreeOfLife-200M

קוד פתוח

imageomicscc0-1.02025-05-27

  • biology
  • image
  • imageomics
  • animals
  • plants

233 מיליון תמונות של קרוב למיליון טקסונים ביולוגיים, שנאספו מארבעה מאגרי ענק עבור אימון מודלי ראייה ממוחשבת. מתאים למי שבונה מודל סיווג רחב ומחפש מגוון ביולוגי שלא קיים במאגרים רגילים.

  • 16,770הורדות בחודש
  • 38לייקים

מה זה

המאגר מורכב מתמונות ביולוגיות מגוונות, כולל תצפיות של חוקרים חובבים, מצלמות שביל ודגימות ממוזיאונים. כל רשומה מקושרת לטקסונומיה הלינאית בשבע רמות, כאשר לכמעט 90 אחוז מהתמונות יש שיוך טקסונומי מלא, לצד שמות מדעיים ושמות עממיים באנגלית לפי GBIF.

הנתונים הגיעו מארבעה מקורות מרכזיים: GBIF, שהוא הספק העיקרי, Encyclopedia of Life, BIOSCAN-5M ו־FathomNet. תהליך הסינון כלל הסרת תמונות של מסמכים וטקסט, ניקוי רעשים מצילומי שטח ומחיקת תמונות שבהן מופיעים בני אדם שניתן לזהות.

המאגר אינו מכיל את קובצי התמונה עצמם אלא מטא-דאטה, קישורים ישירים וקובצי שיבוץ טקסטואליים של המודלים BioCLIP 2 ו־BioCLIP 2.5 Huge. חלקי המאגר כוללים קטלוג מרכזי, נתוני מקור וזכויות יוצרים, מיפוי ייעודי לקבוצות כמו פרושי דרווין וקואורדינטות של תיחום אובייקטים עבור תמונות מ־FathomNet.

מתאים ל

  • אימון מודלי יסוד בביולוגיה

    אימון מודלי CLIP וסיווג תמונות רב-שכבתי על מאגר עצום שמכסה מאות אלפי טקסונים מגוונים.

  • סיווג תמונות Zero-Shot

    שימוש בשיבוצי הטקסט המוכנים לזיהוי מינים ביולוגיים חדשים ללא צורך בכוונון עדין נוסף של המודל.

  • ניתוח תצפיות מצלמות שביל

    בניית מנועי זיהוי לחיות בר בשטח על בסיס דגימות מגוונות של צילומי טבע ומצלמות שטח קיימות.

איפה זה נופל

ההטיה המשמעותית ביותר נובעת ממקור הנתונים. רוב התמונות מקורן בדיווחי אזרחים דרך GBIF, מה שיוצר ייצוג יתר של צמחים וחרקים, ופחות דגימות מקבוצות מיקרוביולוגיות או תצפיות ימיות. התוויות הטקסונומיות מבוססות על שמות מדעיים בלטינית ושמות עממיים באנגלית בלבד, ללא שפות נוספות, כך שאין שמות בעברית. בנוסף, כמחצית מתמונות התצפית בשטח עשויות להכיל רקע מורכב או זיהויים שגויים שמקורם בציבור הרחב, ויש לקחת בחשבון שינויים טקסונומיים שלא תמיד מעודכנים בזמן אמת.

אותה משפחה

TreeOfLife יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר כולל תמונות שאפשר להוריד מיד מהאגינג פייס?

לא. המאגר מכיל רק מטא-דאטה, קובצי Parquet, קואורדינטות ושיבוצי טקסט. כדי להשיג את 233 מיליון התמונות, צריך להשתמש בסקריפטים שמספקים היוצרים כדי להוריד אותן ישירות מהשרתים של GBIF, EOL והמקורות האחרים.

האם אפשר להשתמש במאגר למטרות מסחריות?

הקטלוג שפורסם הוא תחת רישיון נחלת הכלל cc0-1.0 ומאפשר זאת. מנגד, התמונות עצמן שייכות ליוצרים שונים ומגיעות עם רישיונות מגוונים. חובה לבדוק את עמודת הרישיון בקובץ provenance.parquet כדי לסנן תמונות עם הגבלות לא מסחריות.

האם יש שמות של בעלי חיים וצמחים בעברית?

לא. השמות הנפוצים מגיעים ממאגר GBIF ומופיעים באנגלית בלבד, לצד שמות מדעיים בלטינית. מי שמעוניין בהתאמה מקומית יצטרך למפות בעצמו את השמות המדעיים למאגרי שמות בעברית.

איך טוענים

אין צורך בבקשת גישה מיוחדת, אך הדף בהאגינג פייס לא מכיל את התמונות עצמן. הוא כולל קטלוגים בפורמט Parquet, קובצי CSV ושיבוצים שמורים בפורמט npy ו־json. כדי לעבוד עם הדאטה המלא יש להריץ את כלי ה־toolbox של הפרויקט מגיטהאב, שמוריד את התמונות ממקורותיהן ומארגן אותן בקובצי ארכיון shard בפורמט tar של WebDataset. השדות המרכזיים לעבודה הם uuid, מזהה המקור, נתיב הקובץ והרמות הטקסונומיות מדרגת הממלכה ועד המין.

from datasets import load_dataset

ds = load_dataset("imageomics/TreeOfLife-200M")

הרישיון

המאגר עצמו מפורסם ברישיון cc0-1.0, שמקביל לנחלת הכלל ואינו דורש ייחוס או הטלת הגבלות על תוצרי פיתוח ומודלים. עם זאת, התמונות עצמן יורדות ממקורות חיצוניים שונים. לכל תמונה יש רישיון משלה, שמתועד בקובץ provenance.parquet, ולכן לפני שימוש מסחרי במודל שאומן עליהן יש לוודא את תנאי הרישיון של התמונות שנכללו בפועל באימון.

הרישיון המלא ב־Hugging Face ↗