GPT
Z

zh-meme-sft-8k

קוד פתוח

GaryYang123mit2026-03-11

  • conversational
  • dialog
  • chinese
  • Meme
  • humor

מאגר אימון מבוסס שיחות קצרות מסושיאל סיני שמטרתו ללמד מודלים הומור וסלנג רשת. הוא מתאים למי שרוצה בוט שמדבר כמו משתמש אמיתי ברשתות בסין.

  • 189הורדות בחודש
  • 82לייקים

מה זה

המאגר מכיל 8,680 רשומות שמחולקות לסט אימון עם 7,377 דוגמאות, סט אימות עם 868 וסט בדיקה עם 435. כל רשומה מיוצגת במבנה ChatML בסיסי עם הודעת משתמש ותשובת עוזר. כארבעים אחוז מהנתונים הם שיחות בין פוסט לתגובה ראשית, ושישים אחוז תגובות משורשרות.

איסוף המידע נעשה באמצעות סקרייפר Playwright מתגובות ויראליות בסרטונים ופוסטים בדואוין, שיאו-חונג-שו וביליבילי. הטקסטים עברו ניקוי מתוגיות, מזהי משתמשים ואימוג'ים מיותרים, לצד האחדה של אותיות חוזרות. בהמשך הנתונים הורחבו ידנית ובאמצעות מודלי שפה, כדי להעביר את הסלנג לסיטואציות יומיומיות נוספות כמו עבודה, לימודים ומערכות יחסים.

מתאים ל

  • בוט שיחה הומוריסטי

    אימון מודל שמגיב בסלנג רשת סיני ומתאים לאינטראקציה קלילה עם משתמשים.

  • דמויות NPC למשחקים

    יצירת דמויות רקע במשחקי וידאו שמדברות בעוקצנות ובשפה חיה ולא רשמית.

  • מחקר בלשני ותרבותי

    ניתוח האופן שבו ביטויי סלנג מקבלים משמעות חדשה בהקשרים שונים ברשת.

איפה זה נופל

הטקסט כולו במנדרינית ומתבסס על סלנג רשתות שמתיישן מהר מאוד, כך שביטויים מסוימים עשויים לאבד רלוונטיות תוך חודשים. המאגר מטה את המודל לטון ציני, קומי וקליל, ולכן לא מתאים למשימות מקצועיות או שירותיות. היוצרים עצמם מציינים שאימון עליו דורש ערבוב עם כעשרים אחוז של שיחות כלליות כדי למנוע הידרדרות של היכולות הבסיסיות של המודל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא MIT, שמאפשר שימוש מסחרי ללא מגבלות מהותיות. עם זאת, צריך לזכור שהנתונים נגרדו מפלטפורמות סושיאל סיניות, דבר שעשוי להעלות שאלות זכויות יוצרים על התוכן המקורי. יש לצרף את הודעת הייחוס של יוצר המאגר בכל הפצה.

האם יש במאגר טקסטים בעברית או באנגלית?

לא, המאגר מורכב כולו מסינית מדוברת מהאינטרנט. כל הדוגמאות, ההקשרים והסלנג מבוססים על פלטפורמות תוכן סיניות בלבד. הוא לא יועיל למי שמחפש לשפר מודל בשפות אחרות.

איך נאספו הנתונים ומאיפה הם הגיעו?

הנתונים נאספו מסרטונים ופוסטים ויראליים בדואוין, ביליבילי ושיאו-חונג-שו בעזרת סקרייפר Playwright. לאחר מכן הם סוננו מתוכן פרסומי וספאם, ועברו שכתוב והרחבה על ידי מודל שפה. המטרה של התהליך הייתה לשמור על הממים אבל לשבץ אותם בהקשרים רחבים יותר.

האם אפשר לאמן מודל רק על הדאטהסט הזה?

זה לא מומלץ לפי הנחיות היוצר. אימון רק על המאגר הזה יפגע ביכולות השיחה הכלליות של המודל ויהפוך אותו לציני מדי. כדאי לערבב אותו עם לפחות עשרים אחוז של נתוני שיחה רגילים כדי לשמור על יציבות.

איך טוענים

טוענים את המידע ישירות באמצעות ספריית datasets של Hugging Face בלי צורך באישור גישה מראש. הקבצים שמורים בפורמט jsonl פשוט ומחולקים מראש לשלושת הפיצולים הרגילים. המבנה כולל רק את שדה messages שמכיל מערך של אובייקטים עם תפקיד ותוכן, כך שאין צורך בעיבוד מקדים מסובך לפני הזנה למודל.

from datasets import load_dataset

ds = load_dataset("GaryYang123/zh-meme-sft-8k")

הרישיון

המאגר מוגדר תחת רישיון MIT, אף שבכרטיס עצמו מופיע גם תג של Apache 2.0. שני הרישיונות מתירניים מאוד ומאפשרים שימוש חופשי כולל אימון מודלים מסחריים וסגורים, בתנאי ששומרים על הודעת זכויות היוצרים של היוצר. אין חובה לשתף את המודל המאומן תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗