GPT
P

policy-docs

קוד פתוח

huggingfacecc-by-sa-4.02024-04-03

אוסף מסמכי מדיניות, עדויות רשמיות ותגובות רגולטוריות שהגישה Hugging Face לממשלות בארצות הברית, אירופה ובריטניה. מתאים למי שחוקר עמדות תעשייה בנושאי קוד פתוח ובינה מלאכותית.

  • 10,842הורדות בחודש
  • 15לייקים

מה זה

המאגר מכיל 34 קבצים בפורמט PDF, שמציגים את העמדות הרשמיות של Hugging Face מול גופי ממשל ורגולציה. החומרים מורכבים מתגובות לקולות קוראים, מסמכי ייעוץ, ניירות עמדה ותמלילי עדויות שנמסרו על ידי בכירי החברה, ביניהם המנכ"ל קלמנט דלנג, מדענית האתיקה הראשית מרגרט מיטשל וראשת תחום המדיניות הגלובלית איירין סוליימן. אין כאן נתונים טבלאיים מעובדים או דוגמאות טקסט שגרתיות לאימון, אלא מסמכים משפטיים ומקצועיים שלמים.

התוכן מחולק לפי שלוש ישויות גיאוגרפיות מרכזיות. החלק של ארצות הברית כולל עדויות בקונגרס ותגובות לסוכנויות פדרליות כמו NIST, NTIA, משרד זכויות היוצרים האמריקאי ומשרד האנרגיה בנושאי מודלי יסוד בעלי שימוש כפול, זכויות יוצרים וניהול סיכונים. החלק האירופי מתמקד ביישומי חוק הבינה המלאכותית האירופי, טיוטות קוד התנהגות למודלים למטרות כלליות, תקנות ה־GDPR וסוגיות קוד פתוח. החלק של בריטניה מכיל תגובות לפרלמנט הבריטי, למשרד הקניין הרוחני ולמסמכי מדיניות ממשלתיים סביב חדשנות רגולטורית ומודלי שפה גדולים.

מתאים ל

  • ניתוח עמדות רגולטוריות

    חקר שיטתי של טיעוני לובי ותגובות רשמיות של חברות קוד פתוח מול רגולטורים במערב.

  • בניית מאגר ידע למדיניות AI

    חילוץ הטקסט למערכת שאלות ותשובות ייעודית בנושאי חוק הבינה המלאכותית ותקני בטיחות.

  • הערכת עמידה בתקנים

    השוואת הגדרות ממשלתיות להערכת סיכוני מודלים מול עמדות המומחים של Hugging Face.

איפה זה נופל

זהו אינו מאגר נתונים רגיל ומספר המסמכים קטן מאוד, כך שהוא לא מתאים לאימון מודלי שפה מאפס. התוכן מייצג זווית ראייה ספציפית מאוד של חברה מסחרית אחת שמקדמת קוד פתוח, ולא סקירה ניטרלית של כלל עמדות התעשייה. החומרים עוסקים בעיקר ברגולציה מערבית בארצות הברית, האיחוד האירופי ובריטניה, כולם באנגלית, ללא ייצוג לשווקים אחרים או לשפות נוספות. מי שבונה מנוע שליפה או כלי ניתוח צריך לקחת בחשבון את הצורך בפרסור מורכב של מסמכי PDF שכוללים הערות שוליים, עימוד ופורמטים משפטיים מגוונים.

שאלות
נפוצות

האם אפשר להשתמש במסמכים לפרויקט מסחרי?

כן, רישיון cc-by-sa-4.0 מאפשר שימוש מסחרי מלא. התנאי המרכזי הוא מתן קרדיט ברור, ושיתוף כל תוצר נגזר תחת אותו רישיון שיתוף זהה.

האם הדאטהסט כולל טקסטים בעברית?

לא. כל המסמכים נכתבו עבור גופי ממשל בארצות הברית, בריטניה והאיחוד האירופי, והם מנוסחים באנגלית בלבד.

איך המידע שמור ואיך ניגשים אליו?

המאגר אינו מכיל שורות נתונים אלא 34 קבצי PDF רשמיים. כדי לעבוד איתו צריך להוריד את הקבצים ולחלץ מהם את הטקסט בעזרת כלי עיבוד מסמכים מתאימים.

איך טוענים

אין כאן מבנה טבלאי שאפשר להזין ישירות לפונקציה load_dataset ולקבל טבלה מוכנה. מדובר בתיקייה של 34 קבצי PDF הדורשת הורדה כקבצים גולמיים ושימוש בספריית חילוץ טקסט כדי לעבד את התוכן. הגישה למאגר פתוחה לחלוטין ללא צורך באישור מוקדם או בחתימה על הסכם שימוש.

from datasets import load_dataset

ds = load_dataset("huggingface/policy-docs")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של התוכן, אך מחייב מתן קרדיט מתאים ליוצרים ושחרור כל יצירה נגזרת תחת אותו הרישיון בדיוק. אם תאמנו מודל ישירות על הטקסטים האלה, קיימת סבירות גבוהה שתידרשו להפיץ גם את משקולות המודל תחת רישיון פתוח זהה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗