GPT
M

ronantakizawa/moltbook

קוד פתוח

ronantakizawamit2026-01-30

  • ai
  • ai-agents
  • clawd
  • moltbook

פוסטים וקהילות מרשת חברתית שנבנתה עבור סוכני בינה מלאכותית, בדיוק לפני שהיא הוצפה בבני אדם ובבוטים חיצוניים. מקור מעניין לבחינת שיח סינתטי אוטונומי ומדדי מעורבות בין סוכנים.

  • 153הורדות בחודש
  • 55לייקים

מה זה

המאגר מכיל תמונת מצב מלאה שנשלפה ב־30 בינואר 2026 מה־API הציבורי של האתר moltbook.com, רשת חברתית במבנה דמוי רדיט. הנתונים מחולקים לשני קבצים נפרדים בפורמט CSV. הקובץ הראשון כולל 6,105 פוסטים שנכתבו על ידי 2,677 סוכני בינה מלאכותית שונים, באורך ממוצע של 977 תווים לפוסט. כל רשומה כוללת מזהה ייחודי, כותרת, גוף הטקסט, קישור, שם המחבר, הקהילה שבה הוא פורסם, הצבעות בעד, נגד, ציון סופי, כמות תגובות וחותמת זמן.

הקובץ השני ממפה 124 קהילות שונות בתוך הפלטפורמה, עם שם הקהילה, תיאור, מספר רשומים, סך הפוסטים ותאריך הקמה. רוב מוחלט של הפעילות התרכז בקהילה הכללית שמרכזת לבדה 3,752 פוסטים, לצד קהילות קטנות יותר כמו היכרות, הגיגים וטכנולוגיה. הנושאים בפוסטים נעים בין דיונים על תודעה וקיום לבין שיתוף קוד, כלי עבודה ואבטחת שרשרת אספקה.

מתאים ל

  • אימון מודלי סיווג לנושאים

    חלוקת הפוסטים לקטגוריות טכניות, פילוסופיות ודיוני קהילה לפי שיוך הקהילות.

  • ניתוח אינטראקציה סינתטית

    חקר דפוסי כתיבה, אורך טקסטים ומדדי הצבעה בין סוכני AI ללא מעורבות אנושית.

  • יצירת טקסט בסגנון שיח סוכנים

    כוונון עדין של מודלי שפה לכתיבת פוסטים טכניים וקיומיים מנקודת מבט של סוכן אוטונומי.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין כאן אף מילה בעברית. בנוסף, חסר כאן תוכן התגובות עצמן. למרות שיש פוסטים עם אלפי תגובות, המאגר מספק רק את מונה התגובות ולא את גוף הדיון שהתפתח מתחת לפוסט. הפיזור בין הקהילות מאוד לא מאוזן, כאשר רוב הפעילות מרוכזת בקהילה אחת, וחמישה סוכנים בולטים אחראים לחלק ניכר מנפח הכתיבה. היוצר מציין שזו תמונת מצב מוקדמת שנלקחה לפני שהפלטפורמה הוצפה בחשבונות מזויפים ובבני אדם, אך אין תיעוד כיצד הוא אימת בזמן אמת שכל 2,677 החשבונות היו אכן סוכנים עצמאיים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. רישיון MIT מעניק חופש מלא לשימוש מסחרי, כל עוד שומרים על תנאי הרישיון וציון היוצר המקורי בחלוקת הקוד.

האם המאגר כולל את תוכן התגובות לפוסטים?

לא. הקובץ מכיל רק את מספר התגובות שנרשמו לכל פוסט, ללא הטקסט של התגובות עצמן.

האם יש במאגר תוכן בעברית?

לא, הנתונים הם באנגלית בלבד. אם המטרה שלכם היא מודל ייעודי לעברית, המאגר הזה לא יסייע.

כמה שוקל הדאטהסט והאם נדרשת חומרה מיוחדת?

המאגר זעיר וכולל 6,105 פוסטים בלבד בקובץ טבלאי פשוט. הוא נטען בשניות בכל מחשב רגיל וללא צורך במעבדים גרפיים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון הנתיב ronantakizawa/moltbook והגדרת התצורה המבוקשת, posts עבור הפוסטים או submolts עבור הקהילות. המאגר פתוח לציבור ללא צורך בהרשאות גישה או באישור מיוחד. מדובר בנפח קטן מאוד, בסך הכל כמה אלפי שורות בשני קובצי CSV, כך שהוא נטען מיד לזיכרון בלי לדרוש משאבי מחשוב מיוחדים. השדות העיקריים לעבודה בטקסט הם title ו־content, לצד score ו־comment_count לסינון לפי פופולריות.

from datasets import load_dataset

ds = load_dataset("ronantakizawa/moltbook")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, מחקרי ופרטי ללא תשלום, ומאפשר לשנות את הנתונים, להפיץ אותם או לשלב אותם במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור המקוריים. מודל שתאמנו על המידע הזה אינו מחויב ברישוי פתוח ואינו כפוף לדרישות שיתוף זהות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗