GPT
C

chemistry

קוד פתוח

camel-aicc-by-nc-4.02023-04-16

  • instruction-finetuning

עשרים אלף זוגות של שאלות ותשובות בכימיה שנוצרו כולן על ידי GPT-4. החומר מחולק לנושאים מוגדרים ומתאים למי שמחפש נתונים סינתטיים לאימון מודלים בתחום המדעים המדויקים.

  • 9,274הורדות בחודש
  • 68לייקים

מה זה

המאגר כולל עשרים אלף רשומות שמחולקות בצורה היררכית וקבועה מראש. היוצרים הגדירו עשרים וחמישה נושאים ראשיים בכימיה, לכל אחד מהם הצמידו עשרים וחמישה תתי נושאים, ועבור כל שילוב כזה יצרו שלושים ושתיים בעיות עם פתרונות.

כל שורה מייצגת אינטראקציה בין סוכנים ומכילה חמישה שדות: התפקיד שהוגדר לעוזר, הנושא הכללי, תת הנושא, השאלה או הבעיה שהעוזר התבקש לפתור, והתשובה המלאה שהוא סיפק. הנתונים לא נאספו ממעבדות או מספרי לימוד אלא הופקו כולם באופן סינתטי באמצעות מודל שפה, ללא תיעוד על סינון ידני או בדיקת מומחים בכרטיס המקורי.

מתאים ל

  • אימון מודלים למחקר

    כוונון עדין של מודלי שפה על פתרון בעיות כימיות במסגרת מחקרית שאינה מסחרית.

  • בדיקת יכולות חשיבה

    הערכת ביצועים של מודלים קיימים מול עשרים וחמישה נושאים מוגדרים בכימיה.

  • חקר סוכנים אוטונומיים

    בחינת אינטראקציות ושיחות סינתטיות שנבנו בתבנית של בעיה ופתרון לפי תפקידים.

איפה זה נופל

היוצרים מזהירים במפורש שהתוכן נוצר כולו על ידי GPT-4 ולכן הוא עלול להכיל שגיאות עובדתיות, הזיות וחישובים לא מדויקים. החומר כולו באנגלית בלבד ואין בו שום נגיעה לעברית. הנתונים שוחררו באפריל 2023 ומשקפים את היכולות של המודלים באותה תקופה, בלי אימות מעבדתי או בדיקה של כימאים. מי שמכוון למוצר אמיתי יצטרך לבצע סינון קפדני לפני שמאמנים על זה משהו שממליץ על נוסחאות או תגובות כימיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המוצהר הוא CC-BY-NC 4.0 שמונע כל שימוש מסחרי. מותר להשתמש בנתונים אך ורק לצורכי מחקר והתנסות אישית. אימון מודל שיימכר ללקוחות מפר את תנאי הרישיון של המאגר.

האם המאגר כולל תוכן בעברית?

הנתונים כולם נוצרו בשפה האנגלית בלבד. אין במאגר שאלות או פתרונות בעברית, וגם המונחים המקצועיים מופיעים באנגלית. אם המטרה שלכם היא מודל שמבין כימיה בעברית, תצטרכו לתרגם את החומר או לפנות למקורות אחרים.

איך המידע נוצר ונאסף בפועל?

היוצרים חילקו את תחום הכימיה לעשרים וחמישה נושאים שונים ולכל אחד הגדירו תתי נושאים. לאחר מכן הם הריצו את GPT-4 כדי שיפיק שלושים ושתיים שאלות ותשובות לכל צמד כזה. התהליך כולו מבוסס על יצירה סינתטית של מודל שפה ולא על ליקוט נתונים מהעולם האמיתי.

באיזה פורמט מקבלים את הקבצים?

הנתונים לא נטענים ישירות דרך פקודת load_dataset הרגילה, אלא מגיעים בתוך קובץ ארכיון שנקרא chemistry.zip. מורידים אותו באמצעות huggingface_hub ושומרים מקומית על המחשב. לאחר החילוץ מקבלים את השדות המקוריים שכוללים את התפקיד, הנושא, השאלה והפתרון.

איך טוענים

הנתונים לא מגיעים בטבלאות מוכנות של Hugging Face אלא ארוזים בתוך קובץ דחוס יחיד בשם chemistry.zip לצד קובץ ההסבר. כדי להוריד אותו תצטרכו להשתמש בפונקציה ייעודית מתוך ספריית huggingface_hub שתשמור את הארכיון ישירות אצלכם בדיסק, ואז לחלץ אותו עצמאית לקריאה. אין צורך לבקש אישור גישה מוקדם או להמתין למפתח API ייעודי כדי לגשת לקבצים. השדות המרכזיים שתרצו למפות לקראת אימון הם message_1 שכולל את השאלה ו־message_2 שמכיל את הפתרון המלא.

from datasets import load_dataset

ds = load_dataset("camel-ai/chemistry")

הרישיון

הרישיון הוא CC-BY-NC 4.0, מה שאומר שאסור להשתמש בחומר הזה למטרות מסחריות בשום צורה. מותר לחקור, לנתח ולשתף כל עוד נותנים קרדיט מלא ליוצרים לפי הציטוט שצירפו. אם אתם מתכננים לאמן על זה מודל כדי למכור גישה אליו, הרישיון הזה עוצר אתכם ומשאיר את השימוש באקדמיה ובמחקר בלבד.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗