GPT
C

carbon-pretraining-corpus

קוד פתוח

HuggingFaceBioother2026-05-07

  • biology
  • genomics
  • dna

המאגר מרכז 1.1 טריליון בסיסי דנ"א ורנ"א שמיועדים לאימון מודלי שפה ביולוגיים. הוא משלב גנומים שלמים לצד מקטעי רנ"א שליח מעובדים עם מטא-דאטה טקסונומי עשיר.

  • 3,836הורדות בחודש
  • 30לייקים

מה זה

הנתונים מחולקים לחמישה חלקים ומגיעים משני מקורות מרכזיים, GENERator ו־OpenGenome2. החלק האאוקריוטי מכיל גנומים של פטריות, צמחים ובעלי חיים, כשרצפים מעל מאה אלף בסיסים סוננו החוצה במכוון כדי לשפר ביצועים במשימות המשך. לצדו יש תת-מדגם מוקטן של שישים מיליארד בסיסים ששומר על היחס המקורי בין המינים.

שאר החלקים כוללים גנומים של חיידקים וארכיאות ממאגרי GTDB ו־IMG/PR, וכן שני אוספי רנ"א שליח. אוסף אחד מציג רנ"א מעובד ונקי מאינטרונים, והשני כולל תוספת יזומה של פרומוטורים ואזורי שחבור סביב האקסונים, שחוברו יחד עם מפריד ייעודי כדי לחשוף את המודל לאזורי בקרה ביולוגיים.

מתאים ל

  • אימון מודלי יסוד לגנומיקה

    לימוד ייצוגים סטטיסטיים של רצפי דנ"א ורנ"א על פני מגוון רחב של אורגניזמים חיים.

  • חיזוי אתרי שחבור ובקרה

    שימוש בתת-מאגר הרנ"א המורחב כדי לזהות גבולות אקסונים ופרומוטורים פעילים ברצף.

  • יצירת רצפים מותנית זן

    אימון מודלים גנרטיביים תוך הוספת תגיות טקסונומיה וסוגי גנים בתחילת הקלט.

איפה זה נופל

ההתפלגות הטבעית באוסף האאוקריוטי נוטה בכבדות לחולייתנים, שתופסים קרוב לשבעים אחוז מהנתונים, בעוד שצמחים, פטריות ופרוטוזואה מקבלים נתח זעיר. בנוסף, הסינון של רצפים ארוכים ממאה אלף בסיסים מחייב שרשור ידני אם אתם מאמנים מודל עם חלון הקשר רחב במיוחד. מטא-דאטה טקסונומי זמין רק בחלק האאוקריוטי, ושאר החלקים מכילים רצפים גולמיים בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. כל חלקי המאגר מבוססים על רישיונות מתירניים של MIT ו־Apache 2.0. מותר לאמן מודלים לשימוש מסחרי, ובלבד שמקפידים על תנאי הייחוס של המקורות.

כמה מקום בדיסק צריך כדי להוריד את הכל?

סך כל התצורות מגיע לכחמש מאות ושלושים ושלושה ג'יגה-בייט של קובצי Parquet דחוסים. אם המשאבים מוגבלים, אפשר לעבוד עם תת-המדגם האאוקריוטי ששוקל עשרים ושבעה ג'יגה-בייט או להשתמש בסטרימינג.

איזה סוג מידע ביולוגי קיים ברשומות מעבר לרצף עצמו?

בחלק האאוקריוטי כל שורה כוללת סוג מין, סיווג גנטי, גדיל, מזהה רשומה ומיקומי התחלה וסיום. בחלקי הפרוקריוטים והרנ"א שמגיעים מ־OpenGenome2 יש רק רצפי אותיות ללא נתוני מיקום מפורטים.

מדוע הוציאו מהמאגר רצפים ארוכים ממאה אלף בסיסים?

מפתחי GENERator מצאו שהסרת רצפים ארוכים מאוד משפרת את ביצועי המודל במבחני הערכה במורד הזרם. אם חלון ההקשר שלכם דורש דגימות ארוכות יותר, תצטרכו לשרשר גנים מאותו רצף בעצמכם.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם ציון שם התת-מאגר הרצוי. אין צורך בבקשת גישה מיוחדת, אבל כלל הקבצים שוקלים מעל חמש מאות ג'יגה-בייט בפורמט Parquet, כך שעבודה במצב סטרימינג חיונית אם אין לכם מאגר אחסון מקומי עצום. ברשומות האאוקריוטיות חשוב לשים לב לשדות מזהי המין, סוג הגן והמיקום בכרומוזום לצורך התניה.

from datasets import load_dataset

ds = load_dataset("HuggingFaceBio/carbon-pretraining-corpus")

הרישיון

הרישיון הכללי מוגדר כאחר בגלל איחוד מקורות, אך בפועל כל תת-מאגר מגיע עם רישיון פתוח ומתירני. החלקים האאוקריוטיים שוחררו תחת MIT, וחלקי הרנ"א והפרוקריוטים תחת Apache 2.0. שניהם מתירים שימוש מסחרי, שינוי והפצה, בכפוף למתן קרדיט מתאים, ואינם כופים פתיחה של קוד המודל שתאמנו.

הרישיון המלא ב־Hugging Face ↗