GPT
O

Open-Platypus

קוד פתוח

garage-bAIndרישיון לא דווח2023-08-03

מאגר ממוקד לשיפור יכולות חשיבה לוגית, מתמטיקה ופתרון בעיות קוד במודלי שפה. הוא מאגד נתונים איכותיים מכמה מקורות מובילים שעברו סינון דמיון קפדני.

  • 13,054הורדות בחודש
  • 422לייקים

מה זה

המאגר מכיל בין עשרת אלפים למאה אלף רשומות, ומטרתו העיקרית היא חיזוק החשיבה הלוגית והמדעית. הוא שימש במקור לאימון מודלי Platypus2 ומורכב מחיבור של אחד עשר מאגרים שונים. תמצאו כאן שאלות מדעיות מורכבות, בעיות הוכחה מדעיות ומתמטיות, חידות לוגיות, פתרונות תכנות ומשימות הבנת הנקרא.

תהליך הבנייה שלו כלל סינון כפול. בשלב הראשון בוצע חיפוש לפי מילות מפתח, ובשלב השני הריצו מודל מסוג Sentence Transformers שהסיר כל צמד שאלות עם רמת דמיון סמנטי מעל שמונים אחוזים. מעבר לזה, החוקרים ביצעו בדיקת זיהום והסירו כמאתיים שאלות שהופיעו במבחני הביצועים המקובלים של Hugging Face כדי למנוע הטיה בהערכות.

מתאים ל

  • אימון יכולות הנמקה

    חיזוק יכולות החשיבה הלוגית והסבר שלבי פתרון מורכבים במודלי שפה פתוחים.

  • פתרון בעיות במתמטיקה

    אימון מודלים על הוכחות וחישובים מתוך מקורות כמו MATH ו־TheoremQA.

  • יצירת קוד אלגוריתמי

    שיפור ביצועים במשימות תכנות בעזרת דוגמאות מתוך LeetCode המובנות בפנים.

איפה זה נופל

המאגר כולו באנגלית בלבד. אם המטרה שלכם היא מודל שמבין עברית או פותר בעיות מתמטיות בשפה מקומית, החומר כאן לא יספק את הסחורה ישירות. בנוסף, יש פה ריכוז גבוה מאוד של חידות קוד, מתמטיקה ומדעים, כך שהוא לא מתאים לאימון על שיחה חופשית או כתיבה יצירתית כללית. צריך לבדוק היטב את תאימות הפלטים לתחום שלכם לפני שמשלבים אותו במוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. למרות שהמאגר הכללי לא מציג רישיון, הוא כולל בתוכו מקורות עם תנאי Non-commercial מפורשים כמו ScienceQA ו־ReClor. שימוש מסחרי במודל שאומן על התוכן הזה חושף אתכם לסיכון משפטי.

האם המאגר כולל תמיכה בעברית?

המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. אין בו שאלות, פתרונות או תרגומים בעברית. כדי להשתמש בו עבור מודל מקומי תצטרכו לתרגם את הנתונים באופן עצמאי.

מאיפה הגיעו הנתונים שנמצאים בפנים?

החוקרים אספו שאלות ותשובות מאחד עשר מאגרים קיימים של מתמטיקה, מדע וקוד, ביניהם PRM800K, SciBench ו־LeetCode. הם סיננו שאלות כפולות עם דמיון מעל שמונים אחוז והורידו שאלות שחפפו למבחני הערכה פופולריים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה garage-bAInd/Open-Platypus. אין צורך בבקשת גישה מיוחדת או באישור ידני. כל המידע שמור בקובץ Parquet בודד בתוך תיקיית data, לצד קובץ התיעוד הראשי. מדובר בקובץ אימון יחיד, מה שמפשט מאוד את תהליך ההורדה והעיבוד המקדים לפני שליחה לצינור האימון.

from datasets import load_dataset

ds = load_dataset("garage-bAInd/Open-Platypus")

הרישיון

למאגר עצמו לא דווח רישיון אחיד בכרטיס, וזה הדבר הראשון שחייב להדליק נורה אדומה. הוא מורכב מחלקי מאגרים שחלקם מוגדרים ברישיון MIT או Apache 2.0, אבל אחרים כוללים הגבלות לא מסחריות מפורשות כמו CC BY-NC-SA 4.0 ב־ScienceQA או רישיון Non-commercial ב־ReClor. כל עוד יש שם רכיבים לא מסחריים, אסור להשתמש בתוצר לאימון מודל מסחרי.

הרישיון המלא ב־Hugging Face ↗