GPT
F

fish-vista

קוד פתוח

imageomicsרישיון לא דווח2024-06-10

  • fish
  • traits
  • processed
  • RGB
  • biology

מאגר תמונות מוזיאליות של דגים הכולל תיוגי סיווג טקסונומי לצד חלוקה לסגמנטים של איברים חיצוניים. הוא מיועד למי שמפתח מודלים לזיהוי תכונות מורפולוגיות עדינות בביולוגיה ימית.

  • 15,759הורדות בחודש
  • 24לייקים

מה זה

המאגר כולל עשרות אלפי תמונות דגים שנאספו מאוספים מוזיאליים שונים דרך פלטפורמת Fish-AIR, ביניהם אוספים של מוסדות כמו GLIN, iDigBio ו־Morphbank. התמונות עברו סינון כפילויות, חיתוך, וניקוי רקע לרקע לבן אחיד באמצעות Segment Anything Model לצד בקרה ידנית. שמות המינים עברו סטנדרטיזציה באמצעות Open Tree Taxonomy, ונתוני התכונות הגיעו ממקורות כמו Phenoscape ו־FishBase.

הנתונים מחולקים לפי משימות ברורות. ישנו תת-מאגר לסיווג מינים הכולל כ־48 אלף תמונות של 419 מינים. תת-מאגר לזיהוי תכונות חיצוניות כולל כ־53 אלף תמונות של 682 מינים עם תוויות נוכחות לאיברים כמו סנפירים שונים ובינים. בנוסף, קיים סט קטן ומדויק יותר של 2,427 תמונות שעברו סגמנטציה ידנית ברמת הפיקסל לתשעה איברים שונים על ידי צוות ייעודי בתוכנת CVAT.

מתאים ל

  • סיווג מיני דגים

    אימון מודלים של ראייה ממוחשבת לזיהוי מאות מיני דגים על בסיס מורפולוגיה אחידה.

  • זיהוי איברים מורפולוגיים

    חיזוי רב-תוויות של נוכחות איברים ייחודיים כמו סנפירי שומן או בינים בדגימות ביולוגיות.

  • סגמנטציה אנטומית

    איתור ובידוד של תשעה חלקי גוף מוגדרים ברמת הפיקסל מתוך תמונות גוף שלמות.

איפה זה נופל

ההתפלגות של המינים סובלת מחוסר איזון חריף ומזנב ארוך, תופעה אופיינית לאיסוף היסטורי במוזיאונים. חלק מקבוצות האימון עדיין מכילות כמות קטנה של תמונות רועשות. בנוסף, כל התמונות צולמו בסביבה מוזיאונית מבוקרת עם תאורה שטוחה ורקע מבודד, כך שהן לא משקפות תנאי צילום תת-מימיים בטבע. המטא-דאטה זמין באנגלית בלבד.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המרכזי של הפרויקט הוא CC-BY-NC 4.0 המיועד לשימוש לא-מסחרי בלבד. מעבר לכך, התמונות הבודדות מגיעות ממקורות מוזיאוניים שונים עם תנאי רישוי משלהם. כל נגזרת או מודל שתאמנו על בסיס המאגר לא יוכלו להימכר או לשרת פעילות מסחרית.

האם הדאטהסט כולל תמונות של דגים בטבע?

הנתונים מבוססים על דגימות מוזיאוניות בלבד, ולא על צילומי שטח של דגים חיים בסביבתם הטבעית. כל הדגימות עברו תהליך של הסרת רקע ללבן אחיד כדי להתמקד במורפולוגיה של הדג. מודל שיאומן עליו יתקשה לעבוד בסביבה תת-ימית מציאותית עם עכירות מים או תאורה משתנה.

האם יש צורך בהרצת סקריפטים כדי להשיג את כל התמונות?

הורדה של המאגר ב־Git LFS מספקת את רוב הנתונים, אך כאלף תמונות ברישיון מוגבל אינן כלולות ישירות בקבצים. הכרטיס מספק סקריפט ייעודי שמוריד ומעבד את התמונות האלו ישירות מ־iDigBio. ללא הרצת הסקריפט, חלק מתוך המאגר המוגמר לא יהיה זמין לכם לאימון.

האם קיימת תמיכה בעברית בנתונים?

המאגר מוגדר כולו באנגלית ובשמות מדעיים טקסונומיים בלטינית. אין שמות עממיים בעברית או תיוגים מקומיים לשדות המידע. אם אתם בונים ממשק בשפה העברית, תצטרכו למפות את השמות המדעיים מול מאגרי שמות חיצוניים באופן עצמאי.

איך טוענים

טעינה סטנדרטית דרך הממשק של Hugging Face מושכת רק את קובצי ה־CSV. כדי לקבל את התמונות צריך לשבט את המאגר ישירות עם Git LFS, להעביר את הקבצים מתיקיות החלוקה לתיקייה אחת, ולהריץ סקריפט פייתון נפרד שמושך ומעבד כאלף תמונות נוספות מוגנות בזכויות יוצרים שלא נכללות בהורדה הראשונית.

אין צורך באישור גישה מיוחד. התמונות מגיעות כקובצי JPG ברזולוציות משתנות עם רקע לבן. בקובצי המטא-דאטה, השדות המרכזיים כוללים את נתיב הקובץ, שם המין המעודכן, מזהה התמונה המקורית, ואינדיקטורים בינאריים לקיום איברים כמו סנפיר שומן או בינים.

from datasets import load_dataset

ds = load_dataset("imageomics/fish-vista")

הרישיון

המאגר עצמו מופץ תחת רישיון CC-BY-NC 4.0, שאינו מתיר שימוש מסחרי מכל סוג אלא מחקר והוראה בלבד. תמונות המקור מגיעות עם רישיונות שונים של Creative Commons המפורטים עבור כל רשומה בקובצי ה־CSV. כל מודל שתאמנו על הנתונים הללו יהיה מוגבל למטרות לא-מסחריות, ומחייב מתן קרדיט ליוצרי המאגר ולמוסדות שתרמו את הדגימות המקוריות.

הרישיון המלא ב־Hugging Face ↗