GPT
H

huatuo_encyclopedia_qa

קוד פתוח

FreedomIntelligenceapache-2.02023-05-10

  • medical

מאגר שאלות ותשובות רפואיות שנבנה מטקסטים אנציקלופדיים ומאמרים בסינית. הוא מיועד למי שמאמן מודלי שפה על ידע רפואי מבוסס מקורות כתובים ולא רק משיחות חופשיות.

  • 903הורדות בחודש
  • 91לייקים

מה זה

המאגר כולל 364,420 רשומות של שאלות ותשובות בתחום הרפואה. הנתונים לא מגיעים משיחות אמיתיות בין רופאים למטופלים, אלא חולצו מתוך טקסטים רציפים. בחלק מהמקרים תמצאו שם כמה ניסוחים שונים לאותה שאלה כדי לעזור למודל להתמודד עם שונות לשונית.

המקורות מורכבים משני מאגרים עיקריים. החלק הראשון נאסף מוויקיפדיה בסינית, וכולל 8,699 ערכים אנציקלופדיים על מחלות ו־2,736 ערכים על תרופות. החלק השני מבוסס על 226,432 מאמרים רפואיים שנקצרו מאתר הבריאות Qianwen Health בכתובת 51zyzy.com.

במאגר עצמו החומר כבר מחולק מראש לשלושה קבצי jsonl נפרדים לאימון, בדיקה ואימות: train_datasets, validation_datasets ו־test_datasets, לצד סקריפט טעינה ייעודי. הכרטיס אינו מפרט תהליכי סינון אוטומטיים או ידניים שבוצעו על הטקסטים שחולצו.

מתאים ל

  • אימון מודלי שיחה רפואיים

    התאמת מודלי שפה למענה על שאלות רפואיות מתוך ידע אנציקלופדי מובנה בסינית.

  • הערכת ביצועי מודלים

    בדיקת הדיוק של מודלי שפה קיימים במענה על שאלות מחלות ותרופות באמצעות קובץ המבחן.

  • מחקר חילוץ ידע

    פיתוח שיטות להפקת זוגות שאלות ותשובות מטקסטים רפואיים רציפים ומאמרים.

איפה זה נופל

הנתונים כולם בסינית בלבד, בלי שום ייצוג לעברית, אנגלית או מונחים מקומיים. המידע חולץ מאנציקלופדיות ומאתר תוכן מסחרי, כך שסביר להניח שיש בו הטיות תרבותיות והתאמה למערכת הבריאות והתרופות בסין, ולא לטיפול או רגולציה בארץ. בנוסף, חילוץ אוטומטי של שאלות ותשובות מטקסט רגיל עלול להכניס שגיאות הבנה או עובדות לא מדויקות. הכרטיס לא מציין סינון ידני של רופאים, ולכן אסור להשתמש בזה לייעוץ קליני אמיתי בלי בדיקה מעמיקה של איכות התשובות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון שדווח במאגר הוא apache-2.0, שמאפשר שימוש מסחרי מלא באימון מודלים ובבניית מוצרים. אתם נדרשים בעיקר לתת קרדיט למפרסמים ולצרף את נוסח הרישיון המקורי. אין כאן חובה לפתוח את הקוד שלכם.

האם המאגר כולל תוכן בעברית או באנגלית?

לא, כל הנתונים נאספו מוויקיפדיה בסינית ומאתר Qianwen Health, ולכן הם כתובים בסינית בלבד. אם המערכת שלכם מיועדת לדוברי עברית, המאגר לא יעזור בלי תרגום מלא והתאמה למונחים המקומיים. גם ההקשר הרפואי משקף פרקטיקות ושמות תרופות המקובלים בסין.

איך נאספו השאלות והתשובות במאגר?

החוקרים אספו 8,699 ערכי מחלות ו־2,736 ערכי תרופות מוויקיפדיה, לצד מעל 226 אלף מאמרים מאתר Qianwen Health. מתוך הטקסטים הרציפים האלה הם חילצו זוגות של שאלות ותשובות. חלק מהשאלות כוללות מספר ניסוחים שונים לאותו המידע.

מה ההבדל בין המאגר הזה למאגרי שאלות רופא-מטופל?

בניגוד למאגרי פורומים רפואיים שמציגים שיחות אותנטיות ומקרי בוחן ספציפיים, הנתונים כאן הופקו מתוך טקסט אנציקלופדי ומאמרים מקצועיים. המבנה שלהם עובדתי ותמציתי יותר, אך חסר בהם הדיאלוג הטבעי והניסוח המבולבל של מטופלים אמיתיים. זה הופך אותו למתאים יותר להקניית ידע בסיסי ופחות לניהול שיחה קלינית.

איך טוענים

אתם טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך בבקשת גישה או אישור מראש. הכל יושב בקובצי jsonl מחולקים מראש לסט אימון, ולידציה ובדיקה, ויש גם קובץ סקריפט בשם my_dataset.py שמקל על הטעינה. מדובר בטקסטים בלבד ולכן המשקל הכולל צנוע יחסית לסדרי הגודל של מודלים מודרניים. השדות המרכזיים כוללים את תוכן השאלות, התשובות והניסוחים החלופיים, כך שלא צריך לבצע ניקוי מבני מסובך לפני שמתחילים לאמן.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/huatuo_encyclopedia_qa")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם, בלי חובה לשחרר את התוצר באותו הרישיון. התנאי העיקרי הוא מתן קרדיט ברור ליוצרים המקוריים ושמירה על הודעות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗