GPT
C

Carbon-500M

קוד פתוח

HuggingFaceBioapache-2.02026-05-12

  • transformers
  • safetensors
  • llama
  • text-generation
  • dna

מודל גנרטיבי קטן של חצי מיליארד פרמטרים לרצפי דנא, שנועד בעיקר לרוץ לצד מודלים גדולים כדי להאיץ אותם. הוא חולק טוקנייזר ופורמט עם הגרסאות הכבדות ומוריד זמני יצירה בלי לפגוע באיכות התוצאה.

  • 512Mפרמטרים
  • 8,192טוקנים בהקשר
  • 978 MBמשקל הקבצים
  • 1,736הורדות בחודש

מה זה

זהו מודל אוטורגרסיבי בארכיטקטורת Llama שאומן על 600 מיליארד טוקנים של 6-mer, שזה שווה ערך לכשלושה וחצי טריליון בסיסים. תערובת האימון שלו כוללת גנים אאוקריוטיים, רנא שליח, רנא שליח עם שחבור מועשר, וגנומים של חיידקים. הטוקנייזר ההיברידי משלב קריאה של רצפי דנא ביחד עם BPE של Qwen3 לטקסט אנגלי, כך שכל טוקן גנטי מייצג בערך שישה זוגות בסיסים.

המטרה העיקרית שלו שונה מרוב המודלים בתחום. הוא נבנה כמודל טיוטה עבור Carbon-3B או Carbon-8B בשיטת פענוח ספקולטיבי. במקום לייצר ישירות ממודל ענק ולאט, המודל הזה מנחש רצפים מהר והמודל הגדול רק מאמת אותם, מה שמקצר את זמן הריצה בפועל ומשאיר את הפלט זהה לחלוטין לתוצאה של המודל הגדול לבדו.

מתאים ל

  • האצת פענוח ספקולטיבי

    משמש כמודל טיוטה זול שמייצר הצעות לרצפים עבור Carbon-3B או 8B ומקצר את זמני הריצה.

  • ניקוד הסתברותי לרצפים

    שימוש בענף fns כדי לחשב ציוני סבירות למוטציות ברמת הבסיס הבודד במהירות ובחומרה מינימלית.

  • פיתוח ובדיקות מקומיות

    מאפשר לדבג פייפליינים גנומיים על מחשב נייד לפני שמעבירים עומסים למודלים כבדים.

איפה זה נופל

היוצרים מבהירים במפורש שלא כדאי לבנות עליו למשימות דנא עצמאיות מול מודלים מתחרים. הוא פשוט קטן מדי, והביצועים שלו במבחני downstream מוגבלים בהתאם. בנוסף, חלון ההקשר שלו נעצר ב־8,192 טוקנים, שזה בערך 49 אלף זוגות בסיסים, ללא שלב אימון להקשרים ארוכים יותר. אם אתם חוקרים מקטעים גנומיים ארוכים מאוד או מצפים לתובנות ביולוגיות עמוקות בלי להצמיד אותו לאחיו הגדולים, הוא לא יספק את הסחורה.

אותה משפחה

Carbon יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות ליצירת רצפי דנא?

אפשר טכנית כי הוא causal LM רגיל, אבל היוצרים מדגישים שהביצועים שלו במשימות ביולוגיות מוגבלים. הוא תוכנן לתמוך במודלים הגדולים ולא להחליף אותם כמחולל עצמאי.

איך עובד החישוב ברמת בסיס בודד אם הטוקנייזר מבוסס 6-mer?

טוענים את גרסת ה־fns מתוך ה־repository. במצב הזה המודל מרכיב כל טוקן מתוך התפלגויות של שישה נוקלאוטידים בודדים, מה שמאפשר להוציא הסתברות מדויקת לכל בסיס ברצף.

איך מריצים

בגלל גודל של 512 מיליון פרמטרים ומשקל קבצים של פחות מגיגהבייט אחד, אפשר להריץ אותו בקלות ב־bfloat16 על כמעט כל כרטיס מסך ביתי או שרת בסיסי עם CUDA. בספריית transformers כל מה שצריך זה להעביר אותו כפרמטר assistant_model לקריאת ה־generate של המודל הגדול, והספרייה כבר מנהלת את הניחושים והאימות ברקע.

אם אתם צריכים שליטה ברמת הבסיס הבודד ולא ברמת שלשות או שישיות, יש למודל ענף ייעודי בשם fns שמאפשר חישוב הסתברויות וציינון רצפים ישירות לפי נוקלאוטידים. אין סיבה לפנות ל־API חיצוני עבור מודל כזה, כי העלות החישובית שלו מקומית אפסית וכל הרעיון הוא לצמצם השהיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceBio/Carbon-500M")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקלים, שילוב במוצרים סגורים והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין כאן הגבלות שימוש מסחריות חריגות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗