GPT
T

Traditional-Chinese-Medicine-Dataset-SFT

קוד פתוח

SylvanLapache-2.02024-10-02

  • medical

מאגר כוונון עדין של כמיליארד עד עשרה מיליארד רשומות ברפואה סינית מסורתית. הוא מרכז ידע אנציקלופדי, ספרי לימוד ותיקים קליניים אמיתיים בפורמט הוראות מוכן לאימון.

  • 737הורדות בחודש
  • 105לייקים

מה זה

הנתונים מורכבים ממספר קובצי JSON נפרדים, כולם במבנה של הוראה, קלט ופלט המותאם ישירות לספריית אימון. המאגר מבוסס על שילוב בין מקורות אנציקלופדיים חיצוניים שעברו הגהה אנושית, ספרי לימוד היסטוריים ורשומות רפואיות פנימיות שלא פורסמו בעבר.

התוכן מחולק לפי משימות ורמות עיבוד. חלקי הידע האנציקלופדי והספרות הרפואית שוכתבו לשאלות ותשובות בעזרת מודלים כמו Qwen2.5-14B, deepseek-chat ו־DeepSeek-V2-Lite-Chat. לעומתם, קובצי האבחון והמרשמים נגזרו ישירות מרשומות קליניות של רופאים, תיקים של פרופסור בכיר ומערכות EMR של בתי חולים, באמצעות חוקים מוגדרים מראש וללא התערבות מודל שפה.

מתאים ל

  • אימון סייען אבחון קליני

    כוונון מודלים לשיוך תסמינים למחלות ולתסמונות על פי עקרונות הרפואה הסינית מתוך תיקי חולים.

  • מענה מבוסס ידע רפואי סיני

    מענה על שאלות בנושאי צמחי מרפא, דיקור ומרשמים מתוך מאגרים אנציקלופדיים וספרי לימוד.

  • הפקת מרשמים מותאמים

    לימוד הרכבי תרופות וצמחים בהתבסס על ניסוח חצי מובנה של תלונות מטופל מתוך תיקים רפואיים.

איפה זה נופל

המאגר כתוב בסינית מפושטת בשיעור של 99 אחוזים, ולכן הוא לא רלוונטי למי שמחפש תוכן בעברית או באנגלית ללא תרגום כבד. כל השיחות בנויות מסבב יחיד בלבד, מה שמחייב לערבב אותו עם נתוני שיחה כלליים כדי למנוע שכחה קטסטרופלית במודל. בנוסף, יש הטיה חזקה בהתפלגות התחלואה, כאשר שיעול ועצירות שולטים בחלק גדול מהמקרים הקליניים, וחלק מהרשומות המקוונות הוגדרו על ידי היוצרים כבעלות איכות בינונית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי חופשי. אין חובה לפרסם את המודל המאומן בקוד פתוח. כל שנדרש הוא לספק ייחוס ליוצר המקורי ולכלול את תנאי הרישיון.

האם יש במאגר תמיכה בעברית?

לא, אין במאגר עברית בכלל. כ־99 אחוזים מהתוכן כתובים בסינית מפושטת. כדי להשתמש בו בהקשר מקומי בישראל תצטרכו לתרגם את הנתונים או להשתמש במודל רב-לשוני חזק.

כמה שוקל המאגר להורדה?

נפח הקבצים הוא סביב ג'יגה בייט אחד. מדובר ב־11 קבצים במאגר, רובם קובצי JSON המכילים את נתוני האימון.

מאיפה הגיעו הנתונים והאם הם אמינים?

חלק מהנתונים מגיע מאנציקלופדיות וממאות ספרי לימוד שעובדו לשאלות ותשובות בעזרת מודלי שפה, וחלק אחר נאסף מתיקים קליניים אמיתיים של רופאים ומערכות בתי חולים. היוצר מציין כי הנתונים הקליניים האמיתיים והאנציקלופדיים הם באיכות גבוהה, בעוד נתונים מבתי חולים מקוונים מוגדרים כבעלי איכות בינונית.

איך טוענים

טוענים את הקבצים ישירות דרך כלי אימון סטנדרטיים כמו LLamaFactory, כל עוד הקובץ dataset_info.json נמצא באותה התיקייה. אין צורך באישור גישה והמאגר פתוח להורדה מיידית. נפח המידע הוא סביב ג'יגה בייט אחד, כשהרשומות מגיעות בפורמט JSON של מילון עם מפתחות קבועים: instruction, input ו־output.

from datasets import load_dataset

ds = load_dataset("SylvanL/Traditional-Chinese-Medicine-Dataset-SFT")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן מודלים ללא חובה לפתוח את הקוד של התוצר הסופי תחת אותו רישיון. נדרש רק לשמור על הודעת זכויות היוצרים והייחוס ליוצר המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗