GPT
S

SlimOrca

קוד פתוח

Open-Orcamit2023-10-06

אוסף מרוכז של חצי מיליון דוגמאות חשיבה סינתטיות שנבנו על בסיס פלאן ונוקו באמצעות מודל חיצוני. הוא מיועד למי שרוצה אימון הוראות איכותי בלי לבזבז משאבי חישוב על דוגמאות שגויות.

  • 5,347הורדות בחודש
  • 300לייקים

מה זה

המאגר מכיל תת קבוצה מסוננת מתוך הפרויקט המקורי של אופן אורקה, וכולל סדר גודל של כחצי מיליון רשומות שמבוססות כולן על השלמות של המודל הרביעי. הבסיס לכל הדוגמאות מגיע ממשימות מגוונות של אוסף פלאן, שכוללות מענה על שאלות, סיכום טקסט, סיווגים שונים ושיחה.

הייחוד בגרסה הזו לעומת הגרסאות הקודמות הוא תהליך הניקוי. היוצרים הריצו בדיקה נוספת באמצעות מודל כדי לפסול ולהסיר תשובות שנראו שגויות בהשוואה לתיוגים האנושיים המקוריים של פלאן. הסינון הזה כיווץ את הנפח בערך בשליש, ומאפשר להגיע לביצועים דומים לאימון על המאגר המלא בפחות זמן מעבד גרפי.

הנתונים מגיעים במבנה שיחתי של שרשורי שיחה ומיועדים ישירות לכוונון עדין של מודלי שפה פתוחים. הם מספקים עקבות חשיבה מפורטים ולא רק תשובות סופיות קצרות, מה שעוזר למודל ללמוד תהליכי הסקה מורכבים יותר.

מתאים ל

  • כוונון מודלי שפה פתוחים

    אימון הוראות ממוקד למודלים קטנים כדי לשפר את יכולת ההסקה שלהם במשאבי חישוב מוגבלים.

  • אימון על משימות שיחה

    בניית עוזרים דיגיטליים שיודעים לפרק בעיות ולהסביר שלבי חשיבה למשתמש.

  • הערכת תהליכי סינון

    מחקר על השפעת ניקוי דאטה סינתטי באמצעות מודלים על ביצועי המודל הסופי.

איפה זה נופל

הנתונים כולם באנגלית בלבד. אם אתם מכוונים לפיתוח בעברית, המאגר לא יעזור לכם בלי תרגום מלא של כל הדוגמאות. מעבר לזה, מדובר בטקסט סינתטי שהופק על ידי מודל סגור, ותהליך הסינון נעשה גם הוא על ידי אותו מודל, מה שעלול לשמר הטיות עיוורות או שגיאות שהמודל הבודק לא הצליח לעלות עליהן מול התיוג האנושי.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

היוצרים שחררו את המאגר תחת רישיון אם אי טי שמתיר שימוש מסחרי מלא ללא הגבלות. עם זאת, מכיוון שהתוכן נוצר במקור על ידי מודל סגור מסחרי, מומלץ לבדוק את תנאי השימוש של ספק המודל בנוגע לאימון מודלים מתחרים לפני שמשלבים אותו במוצר ליבה.

האם יש בדאטהסט תמיכה בעברית?

לא, המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. כדי להשתמש בו עבור מודלים בעברית תצטרכו לתרגם את הרשומות באופן עצמאי. ללא תרגום כזה, הוא לא יתרום לביצועי השפה המקומית.

מה ההבדל בינו לבין אופן אורקה המקורי?

הגרסה הזו קטנה יותר ומכילה רק כחצי מיליון רשומות שנבחרו מתוך המאגר המקורי. היוצרים השתמשו במודל כדי לסנן החוצה דוגמאות שבהן התשובה הסינתטית סתרה את התיוג האנושי המקורי של פלאן, במטרה לחסוך שליש ממשאבי האימון.

כמה דוגמאות יש בפנים ואיך הן בנויות?

הדאטהסט מכיל כחמש מאות אלף רשומות בפורמט גייסון שורות שתואם למבנה השיחות של שרפגפט. כל רשומה כוללת חילופי דברים בין משתמש לעוזר עם הסברים מפורטים, ולא רק פלט ישיר של תשובה.

איך טוענים

המאגר פתוח לציבור ואינו דורש אישור גישה מיוחד או מילוי טפסים. הקובץ המרכזי שמכיל את הנתונים שמור בפורמט גייסון שורות במבנה המוכר של שרפגפט, כך שאפשר לטעון אותו בקלות באמצעות ספריית הדאטהסטס הרגילה או לקרוא אותו ישירות בקוד שלכם. לפני שמתחילים לאמן, כדאי לוודא שהפייפליין שלכם יודע לפרסר את מבנה השיחה הספציפי של השדות כדי לשמור על תפקידי המערכת והמשתמש כפי שהוגדרו במקור.

from datasets import load_dataset

ds = load_dataset("Open-Orca/SlimOrca")

הרישיון

המאגר מופץ תחת רישיון אם אי טי פתוח ומתירני. הרישיון הזה מרשה שימוש מסחרי חופשי, שינוי של הנתונים והפצה חוזרת, ללא חובת שיתוף תחת אותו רישיון ובלי הגבלות על מודלים שמאומנים עליו, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗