GPT
A

align-anything

קוד פתוח

PKU-Alignmentcc-by-nc-4.02024-09-28

מאגר נתוני העדפות רב מודלי לאימון מודלים על בסיס השוואות צמד בכל שילוב אפשרי. מתאים למי שרוצה לאלף מודל לקבל החלטות על טקסט, תמונה, אודיו ווידאו יחד.

  • 4,087הורדות בחודש
  • 48לייקים

מה זה

המאגר מציג מבנה השוואתי עבור משימות קלט ופלט מגוונות. בכל רשומה יש בקשה, שתי תגובות שונות של מודלים, ציונים מספריים לפי קריטריונים ברורים והסברים טקסטואליים מנומקים לבחירה. הציונים בוחנים מדדים ספציפיים כמו היצמדות להוראות, בטיחות, עושר מידע, אסתטיקה ואיכות הצליל או התנועה בהתאם לסוג המדיה.

החלוקה הפנימית מוגדרת לפי תצורות משימה. יש כאן קונפיגורציות של טקסט לטקסט, טקסט לתמונה, טקסט לאודיו, טקסט לווידאו, וכן שילובים של תמונה או אודיו יחד עם טקסט שמחזירים פלט כתוב. בחלק מהמשימות קיימת חלוקה לסט אימון וסט אימות, כשמשימות מורכבות כמו טקסט לתמונה מגיעות לעשרות אלפי דוגמאות בכל פיצול.

כרטיס הדאטהסט לא מפרט אילו מודלים בדיוק יצרו את התגובות או מה היו תהליכי הסינון הידניים והאוטומטיים ששימשו לבניית המאגר. המידע מספק בעיקר את הסכמה של הנתונים, שמות המודלים בחלק מהשדות, ואת הפידבק שנרשם עבור כל תוצר.

מתאים ל

  • אימון מודלי תגמול רב מודליים

    לימוד מודל לדרג איכות של פלט תמונה, אודיו או וידאו מול הנחיית טקסט לפי ציונים ונימוקים.

  • אימון DPO רב תחומי

    כוונון מודלים על בסיס העדפות ישירות בין זוגות תגובה בטקסט, קול ומדיה חזותית.

  • הערכת בטיחות ועמידה בכללים

    בדיקת יכולת המודל לזהות תוכן לא בטוח או חריגה מהוראות על פני ערוצי תוכן שונים.

איפה זה נופל

הכרטיס משמיט מידע קריטי על מקורות הדאטה, שיטות הסינון והשפות הנתמכות. אין התייחסות ישירה לקיום שפות שאינן אנגלית, ולכן הנחת העבודה צריכה להיות שהתכנים מוטים לחלוטין לאנגלית. בנוסף, חסר פירוט על תהליך בקרת האיכות של נתוני הווידאו והאודיו, ואין תיעוד של מנגנוני הסינון להסרת הטיות תרבותיות או חומרים פוגעניים לפני הדירוג.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון שהוגדר הוא cc-by-nc-4.0 שמונע במפורש שימוש מסחרי. כל אימון של מודל המיועד להפצה מסחרית מפר את תנאי הרישיון של המפרסמים.

האם המאגר כולל תמיכה בעברית?

הכרטיס אינו מזכיר שפות כלל ואינו מציין תמיכה בעברית. לפי הדוגמאות וההגדרות מדובר במאגר שנבנה באנגלית בלבד, ולכן לא הייתי בונה עליו לפרויקטים מקומיים.

מה נפח האחסון שצריך להכין מראש?

המאגר מפוצל לחלקים שונים בעלי משקל משתנה. חלק הטקסט שוקל מאות מגה בייטים בודדים, אך חלקי המולטימדיה מגיעים לעשרות ג'יגה בייטים, כגון חלק התמונות שמגיע לכעשרים ושניים ג'יגה בייט בפיצול האימון.

איך נאספו הדוגמאות והדירוגים בפועל?

דף המאגר אינו חושף את תהליך האיסוף או את זהות המדרגים. הוא מספק רק את התוצאה הסופית שכוללת שתי תגובות ממודלים, ציונים בחלוקה לקטגוריות שונות וטקסט ביקורת.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות בחירת הקונפיגורציה הרצויה, למשל text-to-image או text-audio-to-text. הגישה למאגר פתוחה לחלוטין וללא צורך באישור מוקדם. הפורמט מבוסס קבצי Parquet שמכילים נתוני מדיה חיים כמו תמונות מוטמעות וקבצי אודיו, לצד שדות דירוג ונימוקים. משקלי החלקים משתנים מאוד, חלק הטקסט שוקל כמאה וארבעים מגה בייט בעוד חלקים הכוללים תמונות או אודיו עוברים את רף עשרים הג'יגה בייט, ולכן מומלץ לבחור רק את המשימה הדרושה ולא למשוך את המאגר כולו.

from datasets import load_dataset

ds = load_dataset("PKU-Alignment/align-anything")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. המשמעות פשוטה: השימוש מותר למטרות מחקר ולימוד בלבד, ואסור לכל שימוש מסחרי ישיר. מודל שאומן על הנתונים האלה כבול במגבלות אלו, כך שלא תוכלו למכור שירות או מוצר שמבוססים עליו. הרישיון דורש גם מתן קרדיט מלא ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗