GPT
O

opengenome2

קוד פתוח

arcinstituteapache-2.02025-02-17

  • biology
  • DNA
  • genomics
  • genetics
  • metagenomics

מאגר גנומי ענק של 8.8 טריליון זוגות בסיסים מכל תחומי החיים. נבנה במקור כדי לאמן את מודלי Evo 2, ומתאים למי שבונה מודלי שפה ביולוגיים ישירות מרצפי דנא.

  • 21,358הורדות בחודש
  • 156לייקים

מה זה

המאגר כולל רצפי דנא גולמיים ומעובדים שמכסים חיידקים, ארכאונים, אאוקריוטים ווירוסים. הנתונים נאספו משורה ארוכה של מאגרים ציבוריים מוכרים, ביניהם GTDBv220, IMG/PR, מאגרי מטאגנומיקה כמו MGD DB, וכן NCBI ו־Ensembl עבור אאוקריוטים ורנא. המאגר מציע גם מטא-דאטה של המינים בקובץ ייעודי בשם species_metadata.csv שיושב בתיקייה הראשית.

המבנה מחולק לשתי תיקיות מרכזיות לפי פורמט העבודה. תיקיית fasta כוללת את הרצפים הגנומיים עצמם, כמו חלונות גנומיים של 5 קילו-בסיס מאאוקריוטים. תיקיית jsonl מכילה את הרצפים המעובדים ששימשו לאימון בפועל, כולל הוספת טוקנים מיוחדים ותגיות פילוגנטיות שנועדו להכוונת המודל.

מתאים ל

  • אימון מודלי שפה ביולוגיים

    אימון מודלי יסוד על רצפי דנא מגוונים באורך מלא או בחלונות קצרים.

  • מחקר ביואינפורמטי והשוואתי

    ניתוח רצפים גנומיים מאורגניזמים שונים באמצעות קובצי ה־FASTA המאוחדים.

  • אימון מודלי הקשר ארוך

    שימוש בקובצי ה־JSONL המתוייגים פילוגנטית להרחבת חלון ההקשר של מודל קיים.

איפה זה נופל

חלוקת המידע מוטה מאוד ולא מאוזנת. בשלב ההרחבה רוב הטוקנים מגיעים מבעלי חיים וצמחים, בזמן שקבוצות שלמות כמו פרוטיסטה וכרומיסטה מקבלות ייצוג שולי של פחות מאחוז. אם אתם בונים כלי למחקר מיקרוביאלי ספציפי או לאורגניזמים נדירים, אי אפשר להסתמך על חלוקת הדגימה המקורית בלי לאזן אותה מחדש בעצמכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון Apache 2.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים לשימוש פנימי או מסחרי. יש לוודא שאתם מצייתים לדרישות הייחוס של המאגרים הציבוריים המקוריים שמהם נאסף המידע.

האם המאגר דורש כוח מחשוב מיוחד?

בהחלט. מדובר ב־8.8 טריליון זוגות בסיסים שמפוזרים על פני יותר מאלף קבצים מכווצים. פריקה, אחסון ואימון על כמות כזו דורשים שרתים ייעודיים עם נפח דיסק עצום, ולא מתאימים לעבודה על מחשב אישי.

האם יש במאגר טקסט בשפה טבעית?

לא. למרות שהוא מסווג תחת text-generation, המאגר מורכב מרצפי דנא וקוד גנטי בארבע אותיות הבסיס, לצד תגיות פילוגנטיות בפורמט מובנה. אין בו טקסט רגיל בעברית או באנגלית מעבר לקובצי המטא-דאטה.

איך טוענים

אין כאן הורדה בכפתור אחד של Hugging Face Datasets רגיל. המאגר מורכב מ־1,126 קבצים, שרבים מהם מכווצים ומפוצלים לחלקים, למשל קובצי fasta.gz עם סיומות כמו aa ו־ab. תצטרכו להוריד את הקבצים ישירות, לאחד ולפתוח אותם מקומית. אין צורך בבקשת גישה מיוחדת, אבל תצטרכו נפח אחסון ותשתית עיבוד שמסוגלים להתמודד עם טריליוני בסיסים לפני שמתחילים לגעת במידע.

from datasets import load_dataset

ds = load_dataset("arcinstitute/opengenome2")

הרישיון

הרישיון הוא Apache 2.0. הוא מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו רישיון. חובה לשמור על הודעות זכויות היוצרים והרישיון המקורי. בנוסף, המפרסמים מבקשים לתת ציטוט למאגרי המקור הציבוריים שמהם נדגמו הרצפים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗