GPT
B

biology

קוד פתוח

camel-aicc-by-nc-4.02023-04-16

  • instruction-finetuning

מאגר של עשרים אלף זוגות בעיה ופתרון בביולוגיה שנוצרו באמצעות מודל שפה. הוא מתאים למי שמחפש דאטה סינתטי מובנה בתחום מדעי החיים עבור משימות יצירת טקסט.

  • 6,446הורדות בחודש
  • 58לייקים

מה זה

המאגר כולל עשרים אלף זוגות של שאלות ותשובות שנוצרו באופן סינתטי לגמרי על ידי gpt-4. המבנה מבוסס על עשרים וחמישה נושאים ראשיים בביולוגיה, כאשר תחת כל נושא הוגדרו עשרים וחמישה תתי נושאים. עבור כל שילוב כזה של נושא ותת נושא, נוצרו שלושים ושתיים בעיות עם פתרונות תואמים.

הרשומות מציגות חלוקה מוגדרת היטב של שדות. כל רשומה כוללת את תפקיד העוזר, הנושא הראשי, תת הנושא, תוכן הבעיה שהעוזר התבקש לפתור, ותוכן הפתרון שסיפק. המפרסמים לא מפרטים תהליך סינון ידני או בקרת איכות של מומחים, אלא מסתמכים על הפלט הישיר מהשיחה בין הסוכנים.

מתאים ל

  • אימון שאלות ותשובות מדעי

    כוונון עדין של מודלי שפה על בעיות ופתרונות בביולוגיה ברמת פירוט מוגדרת.

  • מחקר סוכנים אוטונומיים

    ניתוח אינטראקציות ואיכות פלטים שנוצרו על ידי שיחות בין סוכני בינה מלאכותית.

  • בדיקת איכות של ידע סינתטי

    הערכת שיעור ההזיות והטעויות העובדתיות בתשובות מדעיות שנוצרו באמצעות gpt-4.

איפה זה נופל

היוצרים מזהירים במפורש שהדאטה נוצר כולו על ידי gpt-4 ועשוי להכיל שגיאות עובדתיות, הזיות ואי דיוקים מדעיים. אין כאן בדיקה של ביולוגים אנושיים, והתוכן זמין באנגלית בלבד ללא שום ייצוג לעברית. בנוסף, מדובר בחומר מבוסס מודלים מוקדמים של 2023, כך שהוא לא מתאים לאימון מוצר רפואי או מדעי קריטי בלי מעבר קפדני של אנשי מקצוע על כל פלט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון הוא cc-by-nc-4.0 שמיועד לשימוש לא מסחרי בלבד. כל שימוש בתוך מוצר מניב רווח או מודל שנועד למכירה מפר את תנאי הרישיון.

האם יש בדאטהסט תמיכה בעברית?

אין שום תוכן בעברית. כל זוגות השאלות והתשובות וכל שמות הנושאים נוצרו באנגלית בלבד.

מאיפה הגיעו הנתונים שבקובץ?

הנתונים נוצרו באופן מלאכותי משיחות של gpt-4 על בסיס רשימה של נושאים ותתי נושאים. הם לא נלקחו מספרי לימוד, ממאמרים אמיתיים או ממבחנים קיימים.

איך טוענים

הנתונים לא מגיעים בפורמט טבלאי פתוח ישירות בעמוד, אלא ארוזים בקובץ דחוס יחיד בשם biology.zip. כדי להוריד אותו צריך להשתמש בפונקציה ייעודית מתוך ספריית huggingface_hub שתוריד את קובץ הזיפ למחשב. אין צורך בבקשת גישה מיוחדת או באישור ידני. לאחר החילוץ, השדות העיקריים שצריך למפות לעיבוד הם message_1 שמכיל את השאלה ו message_2 שמכיל את התשובה.

from datasets import load_dataset

ds = load_dataset("camel-ai/biology")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. הרישיון הזה אוסר כל שימוש מסחרי מכל סוג שהוא, ומחייב מתן קרדיט מתאים ליוצרים. אם תאמנו מודל על הדאטהסט הזה, לא תוכלו למכור שירותים שמבוססים עליו או לשלב אותו במוצר שמייצר הכנסה, והוא מוגבל למחקר בלבד.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗