GPT
G

GrandMaster-PRO-MAX

קוד פתוח

Vikhrmodelsapache-2.02024-07-19

מאגר הוראות ותשובות שמיועד לאימון מודלים ברוסית עם יכולת הסקה מובנית. כל התשובות נוצרו מאפס במודל GPT-4-Turbo במקום להסתמך על תרגום מכונה של תשובות קיימות.

  • 781הורדות בחודש
  • 78לייקים

מה זה

המאגר מכיל 155,291 זוגות של הנחיות ותשובות, בעיקר ברוסית ובאנגלית. היוצרים לקחו רק את פקודות המקור ממאגרים מוכרים כמו lmsys-chat-1m, Saiga, Tagengo, SystemChat ו־Infinity-Instruct, והוסיפו כחמישים אלף פקודות סינתטיות במגוון נושאים, כולל מתמטיקה, תכנות, משימות כתיבה ונושאים שקשורים לרוסיה.

לאחר איסוף ההנחיות בוצע ניקוי כפילויות באמצעות המודל multilingual-e5-large בסף דמיון קוסינוס של 0.975, לצד שינויים יזומים באותיות גדולות, פיסוק ומחיקת פתיחים שחוזרים על עצמם. את כל התשובות יצרו מחדש באמצעות GPT-4-Turbo-1106, עם הנחיית מערכת שדרשה כתיבה ברוסית טבעית, חלוקה שלבי מחשבה בפורמט Markdown והסבר מקדים על מושגים מורכבים.

מתאים ל

  • אימון SFT למודל ברוסית

    כוונון עדין של מודלים פתוחים במטרה לייצר מענה מפורט ומובנה ברוסית.

  • הטמעת שרשרת מחשבה

    לימוד מודלים לפרק שאלות מורכבות לשלבים לפני מתן המענה הסופי.

  • מחקר על דאטה סינתטי

    בדיקת השפעת תשובות מסונתזות של GPT-4 על ביצועי מודלי שפה.

איפה זה נופל

אם אתם בונים מערכת שמשרתת משתמשים בעברית, המאגר הזה פשוט לא בשבילכם. כמעט כל התשובות נכתבו ברוסית, 128,149 רשומות, והשאר באנגלית, כעשרים וחמישה אלף. מעבר לזה, כל התשובות הן פלט סינתטי של מודל יחיד מסוף שנת 2023, כך שהן נושאות את ההטיות, טעויות ההיגיון והסגנון המאפיינים את מנועי OpenAI.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מודלים בעברית?

לא, אין כאן נתונים בעברית בכלל. הדאטהסט כולל בעיקר רוסית ומעט אנגלית. אם המוצר שלכם פונה לקהל ישראלי בשפתו, חבל על זמני האימון.

האם מותר להשתמש בו למוצרים מסחריים?

הרישיון של המאגר הוא Apache-2.0 ומתיר שימוש מסחרי חופשי. למרות זאת, כל התשובות הופקו ישירות מ־GPT-4 של OpenAI. תנאי השימוש של החברה אוסרים שימוש בפלטים שלה לאימון מודלים מסחריים מתחרים, ולכן יש לקחת זאת בחשבון מבחינה משפטית.

במה הוא שונה ממאגרי הוראות אחרים ברוסית?

מרבית המאגרים בשפה זו מבוססים על תרגום מכונה של תשובות קיימות באנגלית. כאן היוצרים לקחו רק את שאלות המקור, ויצרו את כל התשובות ישירות ברוסית מול מודל מתקדם עם הנחיות לחשיבה שלב אחר שלב.

האם צריך כוח מחשוב חריג כדי לעבד אותו?

ממש לא, מדובר בכ־155 אלף רשומות בלבד. המאגר שוקל מעט מאוד ומגיע בקובצי Parquet מוכנים, כך שניתן לטעון אותו תוך שניות ספורות בכל מכונה עם כרטיס גרפי סטנדרטי.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets ללא צורך באישור גישה מיוחד. המאגר מפוצל לקובצי Parquet, שניים לסט האימון ואחד לבדיקה. מלבד הטקסט של הפקודה והתשובה, הרשומות כוללות את שפת הפקודה, שפת התשובה, ספירת טוקנים ומזהה אשכול שנוצר באלגוריתם HDBSCAN מתוך 15,149 אשכולות.

from datasets import load_dataset

ds = load_dataset("Vikhrmodels/GrandMaster-PRO-MAX")

הרישיון

המאגר מופץ ברישיון Apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה ללא חובת שיתוף באותו רישיון, כל עוד שומרים על הודעת זכויות היוצרים. יחד עם זאת, התשובות יוצרו ב־GPT-4, ולכן אימון מודל מתחרה עשוי להתנגש עם תנאי השימוש של OpenAI.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗