GPT
S

shofo-tiktok-general-small

קוד פתוח

Shofoother2026-01-13

  • short-form
  • video
  • transcripts
  • multimodal

המאגר מכיל כחמישים אלף סרטוני טיקטוק מלאים לצד טקסטים, תמלולים אוטומטיים ומדדי מעורבות. הוא מיועד למי שצריך נתוני וידאו קצרים אמיתיים יחד עם התגובות וההקשר החברתי שלהם.

  • 6,801הורדות בחודש
  • 22לייקים

מה זה

כל רשומה מייצגת סרטון בודד שנאסף מטיקטוק ומקושר לקובץ MP4 בפועל. לצד הווידאו יש פירוט רחב שכולל תמלול ASR של האודיו, כיתוב מקורי, תגיות, טקסטים מתוך מדבקות על המסך, עד חמישים התגובות המובילות בזמן הדגימה, ומדדי צפיות, שיתופים ולייקים. יש גם סימונים האם הסרטון הוא פרסומת או סומן כתוכן שנוצר בבינה מלאכותית.

האיסוף התבצע דרך הצינור של חברת Shofo בשיטת כדור שלג, שמתחילה מחשבונות זרע ומגלה יוצרים ותגיות נוספים. המטא דאטה נמשך דרך ה־API של טיקטוק, בוצע ניקוי כפילויות לפי מזהי וידאו ברדיס, והסרטונים עברו סינון ידני ואיכותי מתוך מאגר גדול בהרבה שמכיל מאות מיליוני פריטים.

מתאים ל

  • אימון סיווג וידאו

    זיהוי פרסומות, תוכן שנוצר בבינה מלאכותית או נושאים לפי הווידאו והסאונד יחד.

  • חיזוי ויראליות

    ניתוח הקשר בין משך הסרטון, התמלול והטקסט לבין מדדי הצפיות והשיתופים.

  • ניתוח סנטימנט רב-ערוצי

    הצלבת הטקסט של היוצר יחד עם הדיבור ותגובות הגולשים כדי להבין תגובת קהל.

איפה זה נופל

הנתונים מוגבלים לשפות אנגלית וספרדית בלבד, ללא עברית. תמלולי האודיו הופקו במערכת ASR אוטומטית ועלולים להכיל שגיאות זיהוי, או להיות ריקים לגמרי אם אין דיבור. מדדי המעורבות והתגובות משקפים תמונת מצב של רגע האיסוף ולא מתעדכנים. בנוסף, שיטת איסוף בשיטת כדור שלג גורמת להטיה מובנית לכיוון רשתות החשבונות שמהן התחילה הדגימה, ולא מייצגת פילוח עולמי אחיד של הפלטפורמה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ. הרישיון מוגדר כ־other, ובעלי המאגר כותבים בפירוש שהוא ניתן לצורכי מחקר וניסויים בלבד. זכויות היוצרים על הסרטונים שייכות ליוצרים המקוריים ולטיקטוק.

כמה מקום בדיסק צריך בשביל להוריד את המאגר?

צריך לפחות חמש מאות גיגה בייט פנויים כדי להחזיק את כל קובצי הווידאו. אם אתם צריכים רק את הטקסטים, התמלולים ומדדי המעורבות, מספיק להוריד את קובץ הפרקט הבודד ששוקל שבריר מזה.

האם יש במאגר תוכן או תמלולים בעברית?

לא. המאגר מוגדר ומסומן עבור אנגלית וספרדית בלבד, כולל בשדות זיהוי השפה של הכיתובים והתגובות. אין בו דגימה של משתמשים או תוכן מישראל.

איך נוצרו התמלולים של הסרטונים?

התמלולים נוצרו בריצה של מודל זיהוי דיבור אוטומטי על רצועת האודיו. זה אומר שיש מקרים שבהם השדה ריק כי אין דיבור, או שיש בו טעויות פענוח טיפוסיות לרעשי רקע ומוזיקה.

איך טוענים

טוענים את המטא דאטה בקלות דרך ספריית datasets או ישירות מקובץ metadata.parquet בעזרת פנדס, בלי צורך באישור גישה מיוחד. העניין המסובך הוא הנפח. המאגר שוקל כחמש מאות גיגה בייט ומכיל מעל 57,000 קבצים, שרובם סרטוני H.264 בתיקיית הווידאו. לפני שמורידים הכל כדאי למשוך רק את קובץ הפרקט, לבדוק את השדות הרלוונטיים כמו מזהה הווידאו ונתיב הקובץ, ורק אז להחליט אם למשוך את קובצי הווידאו עצמם.

from datasets import load_dataset

ds = load_dataset("Shofo/shofo-tiktok-general-small")

הרישיון

הרישיון מוגדר כ־other, והמפרסמים מציינים במפורש שהמאגר מיועד למחקר ולניסויים בלבד. Shofo מבהירה שאינה בעלת הזכויות על הסרטונים עצמם ומטילה את האחריות המשפטית, כולל תנאי השימוש של טיקטוק וזכויות יוצרים, על המשתמש. במצב כזה, אימון מודל מסחרי עלול לחשוף אתכם לסיכון משפטי ברור ולא מומלץ לעשות בו שימוש במוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗