GPT
G

GLM-5.2-Conversation

קוד פתוח

ianncityapache-2.02026-07-13

  • reasoning
  • chain-of-thought
  • science
  • physics
  • chemistry

מאגר שיחות מזוקק ממודל GLM 5.2 עם דגש על הנמקה גבוהה. הוא נותן חומר אימון מגוון באנגלית למי שרוצה לשפר יכולות שיחה, קוד וחשיבה אנליטית.

  • 814הורדות בחודש
  • 55לייקים

מה זה

המאגר כולל חמישים אלף רשומות המכילות מאה ועשרים מיליון טוקנים בסך הכל. הנתונים מחולקים לכמאה נושאים שונים שמתפרסים על פני שלושה תחומים עיקריים: סגנונות שיחה יומיומיים כמו שירות לקוחות, ברכות והסברים מודרכים, תחומי מדע מדויק שכוללים אלגברה, מכניקת קוונטים וביולוגיה, ומשימות תכנות בשפות רבות כמו פייתון, ג'אווהסקריפט וראסט.

ההנחיות עצמן נוצרו באמצעות המודל GPT-OSS-120b, והתשובות הופקו ישירות מתוך GLM 5.2 בהגדרת הנמקה גבוהה. היוצר מציין כי אין חפיפת פרומפטים מול מאגרים אחרים שלו, אך מעבר לכך כרטיס הדאטהסט לא מפרט תהליכי סינון, ניקוי או בקרת איכות אנושית.

מתאים ל

  • אימון מודלי שיחה

    כוונון עדין של מודלי שפה על סגנונות שיחה מגוונים, הסברים מפורטים ומענה לפניות שירות.

  • שיפור יכולות קידוד

    אימון על משימות פיתוח, בדיקת קוד, ארכיטקטורה וניפוי שגיאות בשפות תכנות פופולריות.

  • הסבר נושאים מדעיים

    לימוד המודל לענות על שאלות לוגיות ולפרק מושגים מורכבים במתמטיקה, פיזיקה ומדעי הנתונים.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שאין כאן שום מענה למי שמחפש שיחות בעברית. בנוסף, מדובר בדאטה סינתטי לחלוטין שנוצר ממודל שפה אחד ששאל ומודל שני שענה, ללא אימות עובדות אנושי או תיעוד על בדיקות רעילות והטיות. מי שמפתח מוצר קצה צריך לסנן בעצמו שגיאות והזיות בתחומי הקוד והמדעים.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, הרישיון המוגדר הוא apache-2.0 והיוצר ציין בעמוד שאפשר להשתמש בנתונים לכל מטרה. הוא רק ביקש שלא תטענו שהמאגר הוא יצירה מקורית שלכם.

האם יש במאגר שיחות בעברית?

לא, השפה היחידה שמוגדרת ומיוצגת במאגר היא אנגלית. כדי לקבל תוצאות בעברית תצטרכו לתרגם את הנתונים או להשתמש במקור אחר.

איך הנתונים נאספו בפועל?

הנתונים נוצרו בצורה מלאכותית לחלוטין. הפרומפטים הופקו באמצעות GPT-OSS-120b, והתשובות נשלפו מתוך GLM 5.2 תחת מצב הנמקה גבוהה.

איך טוענים

טוענים את המאגר ישירות מתוך Hugging Face בעזרת הספרייה datasets של פייתון, על ידי העברת הנתיב המלא של המאגר. המאגר פתוח לציבור ואינו דורש אישור גישה מראש או מפתחות מיוחדים.

הקובץ המרכזי שיושב במאגר מגיע בפורמט dataset.jsonl פשוט. לפני שמתחילים להריץ תהליך אימון, כדאי לקרוא מדגם שורות ולבדוק את שמות המפתחות והמבנה המדויק של השיחה בקובץ, מאחר שהתיעוד לא מפרט את הסכמה במפורש.

from datasets import load_dataset

ds = load_dataset("ianncity/GLM-5.2-Conversation")

הרישיון

הרישיון הרשמי הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה, גם עבור מודלים שמאומנים על הדאטה. בעמוד היוצר מציין שאפשר להשתמש לכל מטרה ואין חובה לתת קרדיט, אך מבקש לא להציג את החומר כשליכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗