GPT
M

Medical-R1-Distill-Data

קוד פתוח

FreedomIntelligenceapache-2.02025-02-22

  • medical
  • biology

מאגר נתוני אימון שזוקק ישירות מגרסת המקור המלאה של דיפסיק אר אחת. הוא כולל פתרונות ושרשראות חשיבה רפואיות על שאלות שניתנות לאימות.

  • 608הורדות בחודש
  • 76לייקים

מה זה

המאגר מיועד לאימון מודלים של שפה ומבוסס על שאלות רפואיות שניתנות לאימות מתוך פרויקט הואטואו ג'יפיטי או אחת. הרשומות מורכבות משאלות ותשובות שכוללות שרשראות חשיבה מלאות שחולצו בקריאות ישירות לשרתי המקור של דיפסיק אר אחת, בלי קיצורי דרך או עריכות מתווכים.

התוכן הנוכחי ממוקד באנגלית, בזמן שהגרסה הסינית מנוהלת במאגר נפרד לחלוטין. היוצרים מפנים למאמר המדעי שלהם על הפרויקט כדי להבין את מנגנון האימות של השאלות, והם מציעים חלופה ישנה יותר שמבוססת על שרשראות חשיבה שיוצרו עם ג'יפיטי ארבע או.

מתאים ל

  • אימון מודל רפואי ייעודי

    לימוד שרשראות חשיבה לפתרון בעיות קליניות מורכבות על בסיס התוצרים של דיפסיק אר אחת.

  • הערכת יכולות הסקה

    בדיקת איכות הנימוק של מודלים קיימים מול שרשראות החשיבה שנשמרו במאגר.

  • השוואת מנועי הסקה

    השוואת איכות התוכן הרפואי מול שרשראות מקבילות של מודלים מתחרים כמו ג'יפיטי ארבע או.

איפה זה נופל

הנתונים קיימים באנגלית בלבד, בלי שום תמיכה בעברית או התאמה למערכת הבריאות והמינוחים בישראל. מעבר לזה, המידע מגיע מזיקוק של מודל שפה, ולמרות שמדובר בשאלות שמוגדרות כניתנות לאימות, מודלים עדיין נוטים להזיות בעולם הרפואי. לא הייתי מכניס שרשראות חשיבה כאלה למוצר שפוגש מטופלים בלי מעבר ידני של אנשי מקצוע על הפלטים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא אפאצ'י שתיים אפס שמתיר שימוש מסחרי חופשי למדי. צריך להקפיד על מתן קרדיט ליוצרים ושמירה על תנאי הרישיון בקוד או בהפצה. כדאי לזכור שהנתונים זוקקו ממודל אחר, ולכן יש מי שבודק גם את תנאי השימוש של שירות המקור.

האם המאגר כולל תוכן בעברית?

לא, אין בו עברית בכלל. המאגר כולל נתונים באנגלית, והגרסה הסינית שלו נמצאת במאגר נפרד לחלוטין. אם המטרה היא עבודה בעברית, תצטרכו לתרגם את השאלות ואת שרשראות החשיבה בעצמכם.

איך הנתונים נאספו בפועל?

החוקרים השתמשו במאגר שאלות רפואיות שניתנות לאימות מתוך הפרויקט שלהם ושלחו אותן ישירות לגרסה המלאה של דיפסיק אר אחת. הפלטים שהתקבלו, כולל שרשראות החשיבה המלאות, נשמרו כפי שהם כדי לאפשר אימון מודלים אחרים על שיטת ההסקה הזו.

במה הוא שונה מגרסאות קודמות של אותו צוות?

בעבר הצוות פרסם מאגר דומה שהתבסס על ג'יפיטי ארבע או. המאגר הזה מחליף את מקור הזיקוק בדיפסיק אר אחת, במטרה להביא סגנון הסקה שונה ומעמיק יותר שמאפיין את מודל ההסקה הזה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס הרגילה או מורידים את הקובץ medical_r1_distill_sft.json שנמצא במאגר. אין צורך בבקשת גישה מיוחדת או אישור מראש כי המאגר פתוח לכולם. המאגר כולל שלושה קבצים בלבד, כולל תיעוד, כך שהמבנה פשוט ומתאים ישר להזנה לתהליכי אימון בלי סיבוכים מיותרים.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/Medical-R1-Distill-Data")

הרישיון

המאגר פורסם תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במוצרים, כל עוד שומרים על הודעת הרישיון המקורית ונותנים ייחוס ליוצרים. מודל שאומן על הנתונים אינו מחויב להיפתח תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗