GPT
N

NatureLM-audio-training

קוד פתוח

EarthSpeciesProjectother2025-02-28

  • biology
  • bioacoustics
  • audio-classification
  • multimodal
  • Audio-Text-to-Text

מאגר ענק של הקלטות קול וטקסט לאימון מודלי שפה על עולם החי. הוא פותר את הצורך בחיבור ידני בין שאילתות טבעיות לקבצי אודיו של בעלי חיים וסביבה.

  • 21,205הורדות בחודש
  • 18לייקים

מה זה

המאגר מכיל 26,440,512 דוגמאות של זוגות אודיו וטקסט שנבנו עבור מודלים מולטימודליים בביואקוסטיקה. כל רשומה כוללת אות קול, תיאור מילולי, משימה מוגדרת והוראה מתאימה, כך שהמודל לומד לענות על שאלות ישירות מתוך ההקלטה.

המקורות מגיעים ממאגרי נתונים ידועים בתחום, כולל Xeno-canto עם מעל עשרת אלפים שעות, iNaturalist, תצפיות ימיות של Watkins, לצד מאגרי דיבור וסביבה כמו LibriSpeechTTS, UrbanSound ו־NSynth. הנתונים מאורגנים בחתכים קטנים של 2,500 דגימות בכל מקטע, ובנוסף קיים קובץ תגיות שמפרט את השיוך הטקסונומי של כל פריט לפי משפחה, סוג ומין.

מתאים ל

  • זיהוי מינים בשפה טבעית

    אימון מודל שמקבל הקלטת שטח ומחזיר את השם הנפוץ או המדעי של בעל החיים.

  • סיווג שלב חיים והתנהגות

    מענה לשאלות על גיל בעל החיים בהקלטה או סוג הקול שהוא מפיק.

  • יצירת כתוביות לסאונד

    תיאור טקסטואלי מלא של רעשי רקע, סביבה וקולות טבע מקובץ אודיו בודד.

איפה זה נופל

היוצרים מציינים במפורש שהמאגר נוטה באופן מובהק לעופות, למרות הניסיון לגוון את עולם החי. אם המטרה שלכם היא זיהוי יונקים ימיים, זוחלים או חרקים, הכיסוי יהיה דליל משמעותית בהשוואה לציפורים.

כל הטקסטים וההוראות כתובים באנגלית בלבד. בנוסף, מדובר בהרכבה של מאגרים ממקורות חיצוניים שונים שחלקם הוקלטו בתנאי שטח רועשים ואחרים בתנאי מעבדה, כך שאיכות האות משתנה מאוד בין הדגימות ודורשת סינון מקדים לפי הצורך.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, היוצרים מציינים במפורש שהדאטהסט אינו מיועד לשימוש מסחרי. הוא מורכב ממאגרים שונים שחלקם הגדול מוגבל לשימוש מחקרי בלבד תחת רישיונות לא מסחריים. שימוש במסגרת עסקית מחייב סינון קפדני לפי שדה הרישיון של כל רשומה.

האם יש במאגר תמיכה בשפה העברית?

אין במאגר תמיכה בעברית כלל. כל השאילתות, התשובות ושמות המינים מופיעים באנגלית או בלטינית. כדי לעבוד בעברית תצטרכו לתרגם את ההוראות והשמות באופן עצמאי.

איך נאספו הנתונים במאגר?

הנתונים לא הוקלטו מחדש אלא לוקטו מתוך תריסר מאגרים קיימים כמו Xeno-canto, iNaturalist ו־AudioCaps. הצוות חיבר את קבצי הקול עם משימות מובנות, שאלות והנחיות טקסטואליות כדי לייצר פורמט שמתאים לאימון מודלי שיחה.

כמה מקום צריך כדי להוריד את המאגר?

המאגר מורכב ממעל עשרת אלפים קבצי parquet ומכיל יותר מ־26 מיליון רשומות אודיו. גודל הנפח הכולל אינו מפורט ישירות בעמוד, אך שמירת כמות כזו של קול דורשת טרה-בייטים של נפח אחסון. מומלץ לעבוד ישירות בסטרימינג במקום להוריד את כולו.

איך טוענים

טוענים את המידע ישירות דרך הספרייה datasets של Hugging Face בלי צורך בהרשאת גישה מיוחדת, על ידי פיצול train. המאגר עצום ומכיל מעל עשרת אלפים קבצי parquet, ולכן הורדה מלאה לדיסק מקומי דורשת תשתית אחסון גדולה מאוד ומומלץ לעבוד בסטרימינג.

השדות המרכזיים בכל רשומה הם audio שמחזיק את גל הקול במבנה float32, שדה instruction שמכיל את השאילתה עם פלייסהולדר לטוקנים של קול, והשדה output עם התשובה המצופה. שדה metadata מכיל מחרוזת JSON עם פרטים נוספים כמו משך הזמן, קצב הדגימה, המקליט והשיוך הטקסונומי.

from datasets import load_dataset

ds = load_dataset("EarthSpeciesProject/NatureLM-audio-training")

הרישיון

המאגר מוגדר תחת רישיון other והיוצרים מצהירים במפורש שהוא אינו מיועד לשימוש מסחרי. כל רשומה מגיעה ממאגר מקור אחר, כך שלכל דגימה יש שדה license משלה, מחלקים חופשיים כמו CC0 ועד רישיונות מגבילים מסוג CC-BY-NC. אי אפשר לבנות על בסיסו מודל למוצר מסחרי בלי לסנן ולבודד רק את הדגימות שמתירות זאת במפורש.

הרישיון המלא ב־Hugging Face ↗