GPT
T

tiktok-videos-4b

קוד פתוח

kuben-developerother2026-09-02

  • tiktok
  • social-media
  • short-video
  • recommender-systems
  • social-network-analysis

מאגר ענק של 4.5 מיליארד רשומות מטיקטוק שכולל טקסטים ומדדי מעורבות מלאים. מתאים למי שחוקר תפוצה של סאונדים, טרנדים ברשת או מאמן מודלים על טקסט קצר ולא ערוך.

  • 8,167הורדות בחודש
  • 296לייקים

מה זה

המאגר כולל 4.5 מיליארד שורות שמייצגות פוסטים של וידאו ותמונות מטיקטוק, שנדגמו לאורך כשלושה שבועות דרך ה־API הפנימי של אפליקציית האנדרואיד. המידע נאסף מרישומי מכשירים אנונימיים ללא התחברות לחשבונות, ולכן מציג רק תוכן פתוח. כל שורה מכילה מזהה פוסט ייחודי, תאריך פרסום, תיאור הטקסט שכתב היוצר, משך הזמן, תיוגי חשבונות, מזהה ושם הסאונד, ומדדי מעורבות כמו צפיות, לייקים, תגובות, שיתופים ושמירות.

הנתונים שמורים ב־27 קובצי Parquet דחוסים ב־zstd, במשקל כולל של כ־289 גיגה-בייט. הקבצים מייצגים 27 מתוך 32 מחיצות אחסון שחולקו לפי גיבוב של מזהה היוצר, כך שמדובר במדגם אקראי ולא מסונן מתוך כלל המידע שנאסף. כפילויות סוננו לפי מזהה הפוסט, ונשמרה רק הגרסה המעודכנת ביותר שנצפתה.

מתאים ל

  • ניתוח ויראליות של סאונדים

    חיבור פוסטים לפי מזהה הסאונד כדי למדוד היקפי שימוש, צפיות ומעורבות סביב קטעי שמע שונים לאורך זמן.

  • אימון על שפת רשת

    חילוץ מאפיינים וסיווג טקסט מתוך מיליארדי תיאורים קצרים שנכתבו על ידי יוצרים במגוון שפות עיקריות.

  • חיזוי ביצועי פוסטים

    מידול היחס בין אורך הסרטון, שימוש בסאונד מסוים וכמות התיוגים לבין כמות השמירות והתגובות שנרשמו.

איפה זה נופל

הנתונים הם תמונת מצב מנקודת האיסוף ולא סדרת זמן, ולכן ספירת המעורבות תלויה במועד המדויק שבו השורה נדגמה במהלך שלושת השבועות. אין כאן מזהי משתמש, שמות יוצרים או קישורים לקובצי המדיה עצמם, שנמחקו מראש כי פג תוקפם. השפות המוגדרות במאגר הן אנגלית, ספרדית, פורטוגזית, אינדונזית וערבית, ללא עברית רשמית. שדות השפה והמדינה מבוססים על ניחוש של טיקטוק ולעיתים קרובות שגויים, כך שאי אפשר להסתמך עליהם כעובדה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. היוצר שחרר את המאגר לשימוש מחקרי וחינוכי בלבד. מעבר לכך, האיסוף נעשה בניגוד לתנאי השימוש של טיקטוק והוא כולל תוכן שנחשב למידע אישי לפי חוקי הגנת הפרטיות.

כמה מקום בדיסק צריך כדי לעבוד איתו?

כל המאגר שוקל כ־289 גיגה-בייט ומחולק ל־27 קובצי Parquet דחוסים. כל קובץ בודד דורש כ־10 גיגה-בייט, ואפשר לתשאל אותם ישירות באמצעות DuckDB בלי להוריד או לפרוס את כולם מראש.

האם יש במאגר תוכן בעברית?

רשימת השפות הרשמית כוללת אנגלית, ספרדית, פורטוגזית, אינדונזית וערבית בלבד. ייתכן שיש פוסטים בודדים מישראל או בעברית שהסתננו לדגימה, אך שדה השפה והמדינה נקבע על ידי טיקטוק וידוע כלא מדויק.

האם אפשר להוריד דרכו את קובצי הווידאו עצמם?

לא, הקישורים לקובצי המדיה לא נכללים במאגר. הקישורים ברשת של טיקטוק פגים תוך ימים ספורים, ולכן המאגר מכיל מטא-דאטה, מדדים וטקסטים בלבד.

איך טוענים

אתם יכולים לגשת לקבצים ישירות דרך ספריית datasets במצב הזרמה, או לקרוא עמודות ספציפיות בעזרת pandas ו־DuckDB ישירות מקובצי ה־Parquet בלי לפרוס הכל מראש. כל קובץ שוקל בערך 10 גיגה-בייט ומכיל סביב 167 מיליון רשומות, כך שעדיף להתחיל מקובץ בודד כמו videos-00.parquet. אין צורך באישור גישה כדי להוריד. חובה לערבב את השורות לפני האימון, כי הנתונים שמורים באשכולות לפי יוצר, וטעינה רציפה תייצר קבוצות נתונים מתואמות מדי שפוגעות באימון.

from datasets import load_dataset

ds = load_dataset("kuben-developer/tiktok-videos-4b")

הרישיון

המאגר מוגדר תחת רישיון other ושוחרר למטרות מחקר וחינוך בלבד, ללא היתר מסחרי. האיסוף נעשה בניגוד לתנאי השימוש של טיקטוק, והטקסטים נחשבים למידע אישי תחת תקנות פרטיות כמו GDPR. אי אפשר לבנות על בסיסו מוצרים מסחריים, ואסור להשתמש בו לפרופילינג או זיהוי אנשים.

הרישיון המלא ב־Hugging Face ↗