GPT
C

C2S-Scale-Gemma-2-27B

קוד פתוח

vandijklabcc-by-4.02025-10-06

  • transformers
  • safetensors
  • gemma2
  • text-generation
  • biology

המודל הזה לוקח נתוני ריצוף ברמת התא הבודד והופך אותם לרצפי גנים טקסטואליים. הוא מיועד לביולוגים חישוביים שרוצים לסווג סוגי תאים או לחזות שינויים ביולוגיים בלי לאמן רשת מאפס.

  • 28Bפרמטרים
  • 8,192טוקנים בהקשר
  • 50.7 GBמשקל הקבצים
  • 1,639הורדות בחודש

מה זה

במקום לעבוד עם מטריצות ביטוי גנים מסורתיות, הפיתוח הזה של אוניברסיטת ייל וגוגל ממיר את הנתונים למשפטים של שמות גנים שממוינים לפי רמת הביטוי שלהם. המודל מתבסס על הארכיטקטורה של ג'מה 2 בגודל 28 מיליארד פרמטרים, ועבר אימון ייעודי על מעל 57 מיליון תאים של אדם ועכבר ממאגרי מידע ציבוריים.

התוצאה היא כלי שמקבל טקסט באנגלית ומחזיר טקסט. הוא יודע לקבל רשימה של אלף גנים, לזהות לאיזה סוג תא הם שייכים, לסווג רקמות, ואפילו לייצר פרופילי ביטוי חדשים לצורך ניסויים ממוחשבים. כרטיס המודל מציין שהוא מציג שיפור משמעותי מול מודלים קודמים במשימות כמו מענה על שאלות וחיזוי השפעות של מניפולציות גנטיות, אך מפנה למאמר המלא כדי לראות את הציונים המדויקים.

מתאים ל

  • סיווג סוגי תאים

    זיהוי מהיר של סוג התא מתוך רשימת שמות גנים ממוינת, בלי צורך בעיבוד סטטיסטי ידני.

  • אנוטציה לאטלס תאי

    תיוג אוטומטי של רקמות ותאים במאגרי ענק של נתוני ריצוף ברמת התא הבודד.

  • ניסויי ביטוי ממוחשבים

    יצירת פרופילים של ביטוי גנים לבדיקת השערות ביולוגיות ומציאת סמנים ביולוגיים למחלות.

איפה זה נופל

החולשה העיקרית היא התלות המוחלטת בפורמט הפרומפט. אם תשנו את מבנה המשפט שהחוקרים הגדירו, או אם תזינו נתונים מטכנולוגיות ריצוף חדשות שלא נכללו במאגרים המקוריים, הדיוק יצנח מיד. המודל מוגבל אך ורק לגנים, לתאים ולתנאים שהופיעו בנתוני האימון של אדם ועכבר. הוא לא יזהה סוגי תאים חדשים לחלוטין, וכל חריגה מההפצה המקורית מחייבת ולידציה ידנית זהירה לפני שמסתמכים על התוצאות.

שאלות
נפוצות

האם אפשר להשתמש בו לשיחה רגילה או לכתיבת קוד?

לא. למרות שהוא מבוסס על מודל שפה כללי, הוא עבר אימון ייעודי עמוק על ביולוגיה תאית. שימוש בו כמנוע צ'אט רגיל ייתן תוצאות גרועות בהרבה מהמודל המקורי של גוגל.

איך מזינים נתוני מעבדה לתוך המודל?

צריך לקחת את נתוני ספירת הגנים מכל תא, למיין את שמות הגנים לפי רמת הביטוי מהגבוה לנמוך, ולשרשר אותם למחרוזת טקסט אחת מופרדת ברווחים לפי הפורמט שהוגדר בקוד.

איך מריצים

כדי להריץ אותו מקומית בפורמט המקורי צריך כרטיס מסך רציני מאוד. 28 מיליארד פרמטרים בדיוק של bfloat16 שוקלים מעל 50 גיגה בייט, כך שצריך לפחות כרטיס עם 80 גיגה בייט של זיכרון גרפי, או שני כרטיסים חזקים כדי לטעון אותו ולבצע היסק בלי קריסות.

אם אין לכם שרת ייעודי כזה בחברה או במעבדה, הניסיון להריץ אותו בעצמכם יעלה המון זמן ותסכול. במצב כזה, הרבה יותר חכם להשתמש בסביבות ענן כמו קולאב או להקים שרת זמני לפי שעה רק לזמן הניתוח, במיוחד כשיש מחברות הדרכה מוכנות בריפו של הפרויקט.

from transformers import pipeline

pipe = pipeline("text-generation", model="vandijklab/C2S-Scale-Gemma-2-27B")
print(pipe("שלום"))

הרישיון

המשקלים משוחררים תחת רישיון cc-by-4.0. זה רישיון מתירני שמאפשר שימוש מסחרי, שינוי והפצה, כל עוד אתם נותנים קרדיט ברור ליוצרים. קוד המקור בגיטהאב יושב תחת אפאצ'י 2.0, כך שמבחינה משפטית אין בעיה לשלב את המודל בפייפליין של מוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗