GPT
A

AnthropicInterviewer

קוד פתוח

Anthropicmit2025-12-03

תמלילי ראיונות עומק שביצע כלי בינה מלאכותית עם 1,250 אנשי מקצוע על העבודה שלהם עם AI. מתאים למי שחוקר שימושים אמיתיים או בונה מודלים לניתוח טקסט איכותני.

  • 1,085הורדות בחודש
  • 389לייקים

מה זה

המאגר מכיל תמלילים מלאים של ראיונות איכותניים שנערכו בקנה מידה רחב באמצעות כלי ייעודי של אנתרופיק. המטרה היתה לברר איך עובדים משלבים בינה מלאכותית בשגרה המקצועית שלהם ומה הם חושבים על עתיד התחום. כל המשתתפים שרואיינו נתנו הסכמה מדעת לפרסום פומבי של התמלילים הגולמיים שלהם.

הנתונים מחולקים לשלושה קבצי CSV לפי קהלי היעד שנבדקו במחקר. הקבוצה המרכזית כוללת 1,000 ראיונות עם עובדים מכלל כוח העבודה הכללי. בנוסף להם יש שני קבצים ממוקדים יותר, שכל אחד מהם מכיל ראיונות עם 125 משתתפים: קובץ אחד מוקדש ליוצרים ואנשי קריאייטיב, והקובץ השני מוקדש למדענים. אין בכרטיס פירוט לגבי סינון נוסף שנעשה מעבר לחלוקה הזו.

מתאים ל

  • מחקר איכותני על כלי בינה

    ניתוח תפיסות עובדים, חששות ודפוסי שימוש יומיומיים במודלים לפי מקצועות שונים.

  • אימון מודלים לניתוח שיח

    כוונון מודלים לחילוץ תובנות, סיכום ראיונות ארוכים וזיהוי תמות בטקסט שיחתי פתוח.

  • הערכת כלי סקרים מבוססי AI

    בדיקה של אופי השאלות והתשובות שנוצרות בראיון שמנוהל על ידי מודל שפה.

איפה זה נופל

הטקסט כולו באנגלית בלבד. אם אתם מחפשים תובנות על שוק העבודה הישראלי או אימון לעברית, אין כאן כלום. המאגר פורסם בדצמבר 2025 ומשקף דעות של עובדים סביב התקופה הזו. הכרטיס לא מציין דמוגרפיה מלאה מעבר לחלוקה לקבוצות, ולא מפרט הטיות שנובעות מכך שבינה מלאכותית היא זו שניהלה את הראיונות. קחו בחשבון שמדובר בדיווח עצמי של מרואיינים.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. כל הראיונות במאגר נערכו ופורסמו בשפה האנגלית בלבד, ואין בו ייצוג לשפות אחרות.

האם מותר להשתמש בתמלילים לפיתוח מוצר מסחרי?

כן, לפי כרטיס הדאטהסט הנתונים משוחררים תחת רישיון CC-BY שמאפשר שימוש מסחרי. החובה המרכזית היא מתן קרדיט וייחוס מתאים לאנתרופיק לפי דרישות הרישיון והציטוט שמופיע במאגר.

איך המידע נאסף בפועל?

הנתונים נאספו באמצעות Anthropic Interviewer, כלי שביצע ראיונות עומק אוטומטיים עם 1,250 אנשי מקצוע. כל משתתף חתם על הסכמה מדעת לפרסום מלא של התמליל הגולמי שלו.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets או מורידים את קבצי ה־CSV מתיקיית interview_transcripts. אין צורך בבקשת גישה מיוחדת, המאגר פתוח לחלוטין להורדה ישירה. בפנים תמצאו חמישה קבצים, כולל ה־README ושלושת קבצי התמלילים שמחולקים לפי תחומי העיסוק. גודל הקבצים זעיר יחסית כי מדובר בטקסט בלבד, כך שלא צריך משאבי מחשוב מיוחדים כדי לעבד אותם מקומית.

from datasets import load_dataset

ds = load_dataset("Anthropic/AnthropicInterviewer")

הרישיון

יש כאן פיצול ברישוי. המטא-דאטה מדווח על רישיון MIT, אבל הטקסט בכרטיס מבהיר שהנתונים עצמם משוחררים תחת CC-BY והקוד תחת MIT. מבחינה מעשית מותר להשתמש בטקסטים למחקר ולמטרות מסחריות, כל עוד נותנים ייחוס הולם ליוצרים המקוריים לפי תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗