GPT
H

Huatuo26M-Lite

קוד פתוח

FreedomIntelligenceapache-2.02023-10-11

  • medical

מאגר שאלות ותשובות רפואיות בסינית שעבר זיקוק ושכתוב. המטרה כאן היא לקבל נתונים רפואיים נקיים יחסית בלי לגרד בעצמכם מיליוני עמודי רשת גולמיים.

  • 669הורדות בחודש
  • 69לייקים

מה זה

המאגר מכיל 178 אלף רשומות של שאלות ותשובות בתחום הרפואה בסינית. הבסיס מגיע מתוך אוסף ענק של 26 מיליון פריטים שנאספו מהאינטרנט דרך Common Crawl. בגלל שהמידע המקורי היה רועש ומסוכן לשימוש ישיר, החוקרים סיננו כפילויות, שלפו את השאלות הנפוצות ביותר, ודירגו אותן בעזרת ChatGPT.

התשובות הסופיות במאגר אינן התשובות הגולמיות מהרשת, אלא שוכתבו על ידי ChatGPT בהתבסס על המקור. הצוות ביצע הערכה ידנית שאימתה שהשכתוב שיפר את איכות המענה ביחס לטקסט המקורי. המאגר מכסה מגוון בעיות רפואיות, כשהנפוצות שבהן כוללות מחלות עור, הצטננות, אפילפסיה, סוכרת וסרטן.

מתאים ל

  • אימון צ'אטבוט רפואי בסינית

    כוונון עדין של מודלי שפה למענה על שאלות נפוצות של מטופלים.

  • סיווג פניות לפי מחלות

    זיהוי קטגוריות רפואיות ומחלות מתוך טקסט חופשי של שאלות משתמשים.

  • הערכת מודלים ברפואה

    בדיקת ביצועים של מודלים קיימים במשימות הבנה והסבר רפואי.

איפה זה נופל

הנתונים כולם בסינית ואינם כוללים מילה אחת בעברית או באנגלית, כך שהם לא יעזרו לפיתוח מודל מקומי בלי תרגום מלא. מעבר לזה, מקור השאלות הוא סריקה כללית של האינטרנט, והתשובות שוכתבו על ידי מודל שפה. גם אחרי בדיקה ידנית של החוקרים, מודלי שפה נוטים להזיות, ובתחום הרפואי זה סיכון אמיתי. המאגר מתמקד בבעיות בריאות מסוימות לפי תדירות ברשת הסינית ולא מייצג התפלגות קלינית מאוזנת. אסור להשתמש בזה למתן המלצות רפואיות בעולם האמיתי בלי ולידציה של אנשי מקצוע.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. כל 178 אלף הרשומות כתובות בסינית בלבד. אם המטרה היא מודל רפואי בעברית, תצטרכו לתרגם את המאגר או לחפש מקורות אחרים לחלוטין.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי ללא תשלום. התנאי העיקרי הוא מתן קרדיט ליוצרים ושמירה על תנאי הרישיון בקבצי הפרויקט שלכם.

איך נוצרו התשובות שבמאגר?

החוקרים לקחו שאלות ותשובות גולמיות מסריקות Common Crawl, בחרו את השאלות הנפוצות, והשתמשו ב־ChatGPT כדי לנסח מחדש את התשובות. האיכות נבדקה במדגם ידני.

במה המאגר הזה שונה מ־Huatuo26M המקורי?

המאגר המקורי הכיל 26 מיליון רשומות גולמיות ורועשות ישירות מהאינטרנט. גרסת הלייט מצומצמת ל־178 אלף דוגמאות איכותיות שעברו ניקוי, סינון ושכתוב.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הקריאה load_dataset עם הנתיב FreedomIntelligence/Huatuo26M-Lite. אין צורך לבקש אישור גישה מוקדם או להמתין למפתח מיוחד. המאגר פתוח להורדה מיידית וכולל קובץ נתונים מרכזי בשם format_data.jsonl לצד סקריפט טעינה my_dataset.py. הנתונים מובנים במבנה של שאלות ותשובות שמיועד למשימות שיחה, סיווג טקסט ויצירת טקסט. לפני שמתחילים לאמן, כדאי לשים לב שהפורמט מגיע בטקסט סיני בלבד ומבוסס על קובץ JSONL, כך שמומלץ לוודא שהטוקנייזר שלכם תומך בשפה ושהתשובות מתאימות לתבנית הפרומפטים שאתם מריצים.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/Huatuo26M-Lite")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של המידע ושילוב שלו במוצרים סגורים, כל עוד שומרים על הודעת הרישיון ומתן הקרדיט ליוצרים המקוריים. אין חובה לשתף את המודל המאומן או את הנגזרות תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗