GPT
T

tribev2

קוד פתוח

facebookcc-by-nc-4.02026-03-24

הוא לא מייצר טקסט או תמונות, אלא מנבא פעילות מוחית בתגובה לווידאו, קול ומלל. כלי מחקרי נטו שממפה גירויים ישירות למשטח קליפת המוח.

  • 676 MBמשקל הקבצים
  • 43,325הורדות בחודש
  • 697לייקים

מה זה

הארכיטקטורה כאן שונה ממה שרגילים לראות במודלים מולטימודליים רגילים. במקום לתרגם בין סוגי מדיה או לייצר תוכן, הוא פועל כמודל קידוד מוחי עמוק. הקלט הוא סרטון, קובץ שמע או קובץ טקסט, והפלט הוא חיזוי של תגובות fMRI לאורך ציר הזמן.

כדי לעשות את זה, הוא משתמש בשלושה מחלצי מאפיינים נפרדים וחזקים. LLaMA 3.2 3B מטפל בטקסט, V-JEPA2 מעבד את הווידאו, ו־Wav2Vec-BERT מנתח את האודיו. כל הייצוגים האלה נכנסים לטרנספורמר מרכזי שממפה אותם לרשת קליפת המוח ברזולוציה של כ־20 אלף קודקודים לפי תקן fsaverage5.

התוצאה שמקבלים לא מייצגת אדם ספציפי שנבדק בסורק, אלא פרופיל תגובה של נבדק ממוצע. עבור חוקרי מוח ומדעני נתונים, זו דרך לחקור תגובות עצביות לגירויים מורכבים בלי להזמין נבדקים ולשכור שעות יקרות במכשיר MRI, לפחות בשלבי הניסוי הראשוניים.

מתאים ל

  • סימולציה של ניסויי מוח

    ניבוי תגובות עצביות לסרטים וקטעי קול לפני שמבצעים סריקות fMRI יקרות במעבדה.

  • השוואת ייצוגים עצביים

    בדיקת ההתאמה בין שכבות עמוקות של רשתות לבין אזורי פעילות בקליפת המוח.

  • הערכת תוכן מולטימדיה

    מדידת עוצמת התגובה המוחית הממוצעת לגירויים חזותיים וקוליים שונים.

איפה זה נופל

החיסרון המרכזי הוא שהחיזוי משקף מוח ממוצע בלבד ולא תגובה של אדם ספציפי, כך שאי אפשר להשתמש בו לאבחון קליני או למחקר שבודק שונות בין אנשים. בנוסף, כשמעבירים טקסט, המערכת ממירה אותו לדיבור ומבצעת תמלול כדי לקבל תזמונים ברמת המילה, מה שמוסיף שכבת עיבוד שיכולה להכניס שגיאות. אם המדיה שלכם מכילה שפות שאינן נתמכות היטב במודלי הבסיס, הניבויים יאבדו מהדיוק שלהם.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות על מעבד רגיל בלי GPU?

טכנית אפשר לטעון אותו בסיסי להסקה, אבל בגלל התלות במודלי וידאו ושפה כבדים ברקע, זה יהיה אטי מאוד ולא מעשי לעיבוד סרטונים. כרטיס מסך ייעודי נחוץ לעבודה סבירה.

האם הוא מנבא מחלות או פעילות של אדם ספציפי?

לא. הפלט הוא אומדן ממוצע של קליפת המוח מתוך נתוני מחקר, ואין לו יכולת להתאים את עצמו לסריקה של מטופל ספציפי או לשמש ככלי רפואי.

למה צריך אימות מול HuggingFace כדי להשתמש בו?

המודל תלוי ב־LLaMA 3.2 3B לעיבוד הטקסט, ומודל השפה הזה דורש אישור תנאי שימוש והזנת טוקן גישה פרטי כדי להוריד את המשקולות שלו.

איך מריצים

המשקל של הקבצים עצמם קטן מאוד, רק 676 מגהבייט, אבל המשקל הזה מטעה. המודל עצמו נשען על מחלצי מאפיינים כבדים שצריך לטעון ברקע, כולל מודל שפה של 3 מיליארד פרמטרים ומודל ראייה מבוסס Vision Transformer. הרצה מקומית דורשת כרטיס מסך עם זיכרון סביר של 16 גיגהבייט לפחות כדי להחזיק את כל השרשרת בפעולה.

ההתקנה מתבצעת דרך pip ישירות מהמאגר, עם חבילות הרחבה נפרדות להדמיה גרפית של המוח או לאימון מלא. בנוסף, חובה להחזיק חשבון HuggingFace עם טוקן גישה מאושר למודל השפה של מטא, אחרת תהליך טעינת הטקסט ייכשל כבר בשלב האותנטיקציה.

pip install -U huggingface_hub
hf download facebook/tribev2

הקבצים

5 קבצים במאגר, 676 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון CC BY-NC 4.0 אוסר לחלוטין כל שימוש מסחרי. מותר להוריד, לשנות ולפתח על בסיס המשקולות רק למטרות מחקר, לימוד וניסויים פנימיים, תוך מתן קרדיט ליוצרים. אם אתם מתכננים מוצר מסחרי, המודל הזה פסול לשימוש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗