GPT
S

SpanishBCBL

קוד פתוח

bcbl190626cc-by-nc-4.02026-06-19

  • neuroscience
  • meg
  • eeg
  • brain-computer-interface
  • bci

הקלטות מוחיות של אותות MEG ו־EEG מאנשים שמקלידים משפטים ששיננו בספרדית. הדאטהסט מיועד לחוקרי ממשקי מוח-מחשב ופענוח הקלדה ישירות מפעילות מוחית.

  • 3,165הורדות בחודש
  • 70לייקים

מה זה

המאגר מכיל הקלטות מוחיות לא פולשניות של 35 מתנדבים בריאים ודוברי ספרדית שביצעו משימת זיכרון והקלדה. בכל שלב הוצג משפט בספרדית מילה אחרי מילה, ואחרי הפסקה קצרה המשתתף הקליד אותו מהזיכרון על מקלדת מותאמת בלי לראות פידבק על המסך. חמישה משתתפים עשו את שני סוגי הבדיקות, ובסך הכל נאספו כעשרים שעות הקלדה ב־MEG וכשמונה עשרה שעות ב־EEG.

הקבצים מחולקים לשתי ספריות ראשיות לפי סוג ההקלטה. בתוך ספריית ה־MEG יש הקלטות רציפות בפורמט FIF לצד יומני התנהגות בקובצי MAT של MATLAB, ובספריית ה־EEG יש שלשות קבצים בפורמט BrainVision יחד עם קובצי MAT מקבילים. הנתונים ההתנהגותיים מתעדים את המשפטים, לחיצות המקשים המדויקות וזמני התגובה.

מתאים ל

  • פענוח אותות הקלדה ממוח

    אימון מודלים של ממשק מוח-מחשב לחיזוי אותיות ומילים מתוך אותות MEG ו־EEG בזמן אמת.

  • חקר תהליכי שפה ומוטוריקה

    ניתוח הפעילות העצבית המתרחשת במעבר מקריאת משפטים לתכנון מוטורי של הקלדה.

  • השוואת ביצועי MEG מול EEG

    בדיקת איכות הפענוח בין אותות מגנטיים לבין אותות חשמליים שנמדדו מאותם נבדקים.

איפה זה נופל

המחקר מוגבל מאוד מבחינה דמוגרפית. הוא נאסף מ־35 נסיינים בלבד בספרד, 77 אחוז מהם נשים, כולם ימניים ומקלידים מיומנים עם דיוק של לפחות 80 אחוז. כל הגירויים הם משפטים קצרים בספרדית בלבד, כך שאין כאן שום מידע על עברית או שפות עם מערכת כתיבה אחרת. בנוסף, חלק מהמשתתפים קיבלו מזהים שונים במפגשים נפרדים, ואחד הנבדקים נושא שתל מתכתי שדורש סינון ידני כדי לא לזהם את הניתוח.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC 4.0 והוא אוסר במפורש כל שימוש מסחרי. החומרים מיועדים למחקר, הערכה אקדמית וניסויים פנימיים בלבד.

האם הדאטהסט כולל הקלטות או טקסטים בעברית?

לא, אין בו עברית כלל. כל 128 המשפטים ששימשו בניסוי נכתבו והוצגו בספרדית בלבד למתנדבים דוברי ספרדית שפת אם.

כמה שוקל הדאטהסט ואיך מורידים אותו?

המאגר שוקל כ־262 גיגה-בייט ומורכב מ־731 קבצים. ניתן להוריד אותו ישירות מהמאגר או להשתמש בספריית neuralfetch ובקוד Brain2Qwerty שמושך ומסדר את הקבצים אוטומטית.

איזה מידע הוסר מההקלטות המקוריות כדי לשמור על פרטיות?

החוקרים הסירו קובצי סריקת מבנה מוח (MRI), צילומי וידאו של תנועות הראש והעיניים וסרטוני מעקב מהמפגשים. בקבצים הציבוריים נותרו רק אותות ה־MEG וה־EEG המותממים לצד יומני ההקלדה.

איך טוענים

נפח ההורדה מגיע לכ־262 גיגה-בייט וכולל 731 קבצים, לכן צריך מקום ייעודי בדיסק וחיבור יציב. הגישה פתוחה לחלוטין ללא צורך באישור מראש. כדי לא לטבוע בסנכרון ידני של קובצי ה־FIF, ה־EEG וה־MAT, מומלץ להשתמש בספריית neuralset ובקוד של פרויקט Brain2Qwerty בגיטהאב. הכלים האלה מיישרים את הנתונים ומוציאים טבלת אירועים אחידה עם זמני התחלה ומשך לכל לחיצת מקש, מילה או משפט.

from datasets import load_dataset

ds = load_dataset("bcbl190626/SpanishBCBL")

הרישיון

הנתונים מפורסמים תחת רישיון CC BY-NC 4.0. המשמעות היא איסור מוחלט על שימוש מסחרי מכל סוג שהוא. מותר להשתמש בהם למחקר אקדמי ולניסויים אישיים, כל עוד נותנים קרדיט מלא לחוקרים. מודל שאומן על הנתונים הללו כבול למגבלות הרישיון ולא יוכל להימכר כמוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗