GPT
V

values-in-the-wild

קוד פתוח

Anthropiccc-by-4.02025-04-10

המאגר מציג טקסונומיה ושכיחויות של 3,307 ערכים שהתגלו בתשובות קלוד מול משתמשי אמת. הוא מיועד למי שחוקר התנהגות מודלים בפועל בלי לחשוף תוכן שיחות פרטי.

  • 728הורדות בחודש
  • 154לייקים

מה זה

המאגר לא כולל תמלילי שיחות או טקסטים גולמיים של משתמשים. החוקרים באנתרופיק ניתחו מאות אלפי שיחות אמת של קלוד באמצעות תהליך אוטומטי ששומר על פרטיות, וחילצו ממנו רשימה של 3,307 ערכים שהמודל הפגין בתשובותיו, בלי שאף אדם קרא את הטקסט המקורי.

התוכן מחולק לשני קובצי CSV נפרדים. הקובץ הראשון, values_frequencies, מכיל את שמות הערכים ואת אחוז השיחות שבהן הערך זוהה. הקובץ השני, values_tree, מארגן את אותם ערכים בהיררכיה של ארבע רמות, מאשכולות על רחבים ברמה 3 ועד ערכים בודדים ברמה 0, וכולל מזהי אשכולות, תיאורים שנוצרו על ידי מודל שפה, ושכיחות ביחס לכלל מופעי הערכים.

מתאים ל

  • חקר התנהגות מודלים

    ניתוח הערכים שמודלי שפה נוטים להפגין בתשובות למשתמשים בסביבות פרודקשן אמיתיות.

  • הערכת בטיחות והתאמה

    השוואת שכיחויות הערכים של קלוד מול מודלים אחרים או מול עקרונות יישור מערכתיים.

  • מיפוי טקסונומי של ערכים

    שימוש בעץ ההיררכי המוכן כדי לסווג ולנתח תגובות של סוכני שיחה במחקרים שונים.

איפה זה נופל

המאגר מבוסס כולו על חילוץ וסיווג אוטומטיים שביצע מודל שפה, כולל שמות האשכולות והתיאורים שלהם, ולכן עלולות להיות בו שגיאות ואי דיוקים. הסקת ערכים מתוך טקסט היא פעולה סובייקטיבית מטבעה, והחוקרים עצמם מבהירים שאין לראות בנתונים קביעה מוחלטת לגבי הערכים של קלוד או של מודלים אחרים. בנוסף, הנתונים לא מפרטים שפות, כך שאין שום מידע על התפלגות בשיחות בעברית, ואין כאן דוגמאות טקסט שמאפשרות אימון ישיר.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

הכרטיס לא מפרט אילו שפות נכללו בשיחות המקוריות שמתוכן חולצו הערכים. שמות הערכים, האשכולות והתיאורים בקבצים כתובים כולם באנגלית.

האם מותר להשתמש בנתונים למטרות מסחריות?

כן. הרישיון הוא cc-by-4.0, שמאפשר שימוש מסחרי מלא כל עוד מקפידים לתת קרדיט נאות לאנתרופיק בהתאם לדרישות הרישיון.

מה המשקל של הדאטהסט והאם צריך אישור להורדה?

המאגר מורכב משני קובצי CSV קטנים ששוקלים מעט מאוד ונטענים מיידית. אין צורך בבקשת גישה מיוחדת, וההורדה פתוחה לכולם דרך Hugging Face.

האם המאגר מתאים לאימון מודל שפה?

הוא לא מתאים לאימון מודל שפה גנרטיבי כי הוא אינו כולל טקסט שיחות או פרומפטים. הנתונים מתאימים בעיקר כמדד להערכה, מחקר השוואתי, או בניית טקסונומיות לסיווג.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם המאגר והקובץ הרצוי, values_frequencies או values_tree. הגישה פתוחה לחלוטין ללא צורך באישור מוקדם או בהרשמה מיוחדת. הנתונים מגיעים כקובצי CSV קטנים שכוללים עמודות מספריות של שכיחויות, תיאורי אשכולות, וקשרים היררכיים בין מזהי אב למזהי בנים, כך שזמן הטעינה ומשאבי המחשוב אפסיים.

from datasets import load_dataset

ds = load_dataset("Anthropic/values-in-the-wild")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי ושיתוף של הנתונים, בתנאי שניתן קרדיט מתאים ליוצרים. אימון מודל על הנתונים או שילובם במחקר אינו מחייב שחרור של התוצרים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗