GPT
H

huatuo_knowledge_graph_qa

קוד פתוח

FreedomIntelligenceapache-2.02023-05-06

  • medical

מאגר רפואי של שאלות ותשובות שמבוסס ישירות על גרפי ידע. הוא מתאים למי שמאמן מודלים להבנת ישויות וקשרים רפואיים מובנים, אבל מוגבל לסינית בלבד.

  • 451הורדות בחודש
  • 52לייקים

מה זה

במאגר יש 798,444 רשומות שמחולקות לקובצי אימון, בדיקה ואימות בפורמט jsonl. המבנה מבוסס על שאלות שנבנו באמצעות תבניות קבועות, כשהתשובות נשלפו ישירות מתוך ערכים של גרפי ידע רפואיים. המשמעות היא שהמידע מאוד ממוקד עובדתית, אך הניסוחים חוזרים על עצמם בגלל אופי התבניות.

המקורות מגיעים משלושה מאגרים חיצוניים: פרויקט גרף הוויקי הרפואי של CPubMed ושני פרויקטי גיטהאב ציבוריים שמממשים מערכות מענה לשאלות על גבי גרף רפואי. החוקרים לקחו את הישויות והקשרים מהמקומות האלה והמירו אותם לצמדי שאלה ותשובה עבור משימות של יצירת טקסט.

הכרטיס לא מפרט תהליכי סינון או בקרת איכות ידנית שבוצעו על התוכן. החלוקה הפיזית כוללת קובץ סקריפט my_dataset.py לצד קובצי הנתונים, שמתחלקים לסט אימון, סט ולידציה וסט בדיקה ייעודיים בלי פירוט על יחסי הגדלים ביניהם.

מתאים ל

  • אימון מודלים בסינית

    כוונון מודלי שפה בסינית על שלפת עובדות וידע רפואי מובנה מתוך גרפים.

  • בדיקת שליפת עובדות

    הערכת היכולת של מודלים לענות על שאלות תבניתיות מתוך קשרי ישויות רפואיים.

  • טיוב מערכות RAG

    יצירת מאגר בדיקה למערכות חיפוש וגרפים שמתמקדות במינוחים רפואיים בסינית.

איפה זה נופל

כל הטקסט במאגר כתוב בסינית בלבד, כך שאין כאן שום תמיכה בעברית או באנגלית בלי תרגום מכונה מקדים. השאלות נבנו לפי תבניות ולא בידי רופאים או חולים, ולכן הן חסרות גיוון לשוני ואינן מדמות שיחה אמיתית. הנתונים פורסמו במאי 2023 ומבוססים על גרפי ידע חיצוניים, בלי תיעוד על עדכניות המידע הרפואי, מה שעלול לייצר טעויות עובדתיות ומחייב בדיקה רפואית מקצועית לפני כל שימוש מעשי.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

לא. כל 798,444 הרשומות כתובות בסינית בלבד. אם המטרה היא מערכת בעברית, תצטרכו לתרגם את הנתונים עצמאית או לחפש מקור אחר.

האם מותר להשתמש בזה למוצר מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי. עליכם רק לתת ייחוס ליוצרים ולכלול עותק של הרישיון.

איך נוצרו השאלות והתשובות?

החוקרים לקחו ערכים מתוך גרפי ידע רפואיים קיימים ויצרו שאלות בעזרת תבניות אוטומטיות. התשובות הן התוכן שנשלף ישירות מתוך אותם ערכים.

מה החיסרון המרכזי של הנתונים?

הניסוחים מבוססים על תבניות ולא על שאלות של משתמשים אמיתיים. זה יוצר שפה מלאכותית שמתאימה בעיקר לשליפת עובדות יבשה ולא לשיח רפואי חופשי.

איך טוענים

טוענים את המאגר דרך ספריית datasets באמצעות המזהה FreedomIntelligence/huatuo_knowledge_graph_qa. המאגר פתוח לחלוטין ולא דורש אישור גישה מוקדם או מפתחות. הנתונים שמורים בקובצי jsonl מחולקים לפי train, validation ו־test, ולצדם סקריפט טעינה מובנה בשם my_dataset.py שמקל על הקריאה הישירה. מבנה הרשומות כולל שדות של שאלות ותשובות שנוצרו על בסיס התבניות, והשדות העיקריים שמעניינים אתכם הם הטקסטים של השאלה והתשובה לטובת אימון מודלי שפה או הערכה.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/huatuo_knowledge_graph_qa")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הנתונים והפצה מחודשת שלהם. מותר לאמן עליו מודלים מסחריים בלי חובה לפתוח את הקוד או את המשקולות, אך חובה לצרף את תנאי הרישיון המקורי ולתת קרדיט ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗