GPT
T

Turkish-SFT-Dataset-v1.0

קוד פתוח

AlicanKiraz0mit2025-10-25

  • turkish

המאגר כולל כ־5,500 דוגמאות אימון בטורקית עם תשובות ארוכות במיוחד ומבנה שיחה סטנדרטי. הוא מיועד למי שרוצה ללמד מודל שפה לעקוב אחרי הוראות מורכבות, לחשוב שלב אחר שלב ולסרב לבקשות מסוכנות.

  • 327הורדות בחודש
  • 52לייקים

מה זה

הנתונים מחולקים למבנה שיחה פשוט של שלוש עמודות: system, user ו־assistant. כל שורה היא אובייקט JSON נפרד, והדגש העיקרי הוא על פלטים ארוכים של 3,000 עד 4,500 טוקנים לשורה, מה שמצטבר ליותר מ־20 מיליון טוקנים בסך הכל. הדוגמאות מקיפות 12 תחומי יכולת, ביניהם אריתמטיקה והסקה קצרה, עמידה באילוצי פורמט קפדניים, זיכרון לשיחות מרובות תורות, זיהוי כלי תוכנה ומקרי קצה בדקדוק הטורקי.

התוכן כולו סינתטי ולא נאסף ישירות מבני אדם. הוא נוצר משילוב של כמה מודלים מובילים במצב חשיבה גבוה: 30% מ־gpt-oss-120b, 25% מ־Grok 4, 20% מ־Claude Sonnet 4.5, 15% מ־Kimi-K2-0905 ו־10% מ־Claude Opus 4.1. בנוסף, כ־30% מהטקסטים עברו זיקוק ו־RAG מקומי מעל סריקה של כ־100 עד 120 גיגה-בייט של תוכן רשת בטורקית כדי לגוון את הניסוחים.

מתאים ל

  • אימון SFT להוראות מורכבות

    לימוד מודלים בטורקית לציית לאילוצי פורמט נוקשים, הוראות סותרות ושלבי פעולה עוקבים.

  • עמידות להקשרים ארוכים

    אימון מודל להתמודד עם פלטים ארוכים של אלפי טוקנים בלי לאבד את ההקשר המקורי.

  • הטמעת סירוב בטוח

    חיזוק מנגנוני הבטיחות למניעת מענה על הנדסה חברתית, ייעוץ רפואי ותוכן פוגעני.

איפה זה נופל

היוצר מציין בפירוש שלא נעשתה בדיקה ידנית מלאה על הנתונים אלא רק דגימות אקראיות ובדיקות פורמט אוטומטיות, ולכן אי אפשר להסתמך על דיוק עובדתי בלי שכבת בדיקה נוספת. התוכן כולו בטורקית בלבד, אין בו עברית או אנגלית מעבר למילות מפתח בסיסיות, והוא לא מכסה סלנג, ניבים מקומיים או ז'רגון מקצועי צר. מעבר לזה, הערבוב בין חמישה מודלים שונים יצר חוסר אחידות בסגנון הכתיבה, מה שיחייב אתכם לאזן את המשקולות או להוסיף ענישה על סגנון בזמן ה־SFT.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מכיל טקסטים בשפה הטורקית בלבד ומיועד להתאמת מודלים לדוברי טורקית. אם אתם מחפשים נתונים בעברית, המאגר הזה לא רלוונטי עבורכם.

האם מותר להשתמש בו לאימון מודל מסחרי?

כן, רישיון MIT מתיר שימוש מסחרי מלא כולל שילוב התוצר במוצרים מסחריים. תצטרכו רק לכלול את הצהרת הרישיון והקרדיט למחבר בחבילת ההפצה.

כמה רשומות יש במאגר ומה גודלן?

המאגר מכיל כ־5,500 רשומות בפורמט JSONL. למרות מספר השורות הקטן יחסית, כל תשובה מכילה בין 3,000 ל־4,500 טוקנים, כך שסך הנתונים מגיע למעל 20 מיליון טוקנים.

מאיפה הגיעו הנתונים?

התוכן סונתז מכמה מודלים חזקים ובהם Grok 4, Claude ו־gpt-oss-120b במצב חשיבה גבוה. כשליש מהחומר הופק באמצעות שילוב של RAG וזיקוק מתוך סריקה רחבה של דפי אינטרנט בטורקית.

איך טוענים

טוענים את הקובץ ישירות דרך ספריית datasets או קוראים את קובץ ה־JSONL המרכזי בשם TR-part1-261025_v1-fixed.jsonl. אין צורך באישור גישה או ברישום מקדים כי המאגר פתוח לחלוטין. שלושת השדות שמעניינים אתכם באימון הם system להגדרת האילוצים והתפקיד, user להוראות, ו־assistant לפלט המודל. קחו בחשבון שכל שורה שוקלת הרבה מבחינת זיכרון עבודה בזמן אימון בגלל כמות הטוקנים החריגה לפלט בודד.

from datasets import load_dataset

ds = load_dataset("AlicanKiraz0/Turkish-SFT-Dataset-v1.0")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מחקריים ומסחריים, לשנות אותו ולשלב אותו במוצרים סגורים בלי חובת שיתוף של הנגזרות. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, והוא אינו מגביל מודלים שאומנו על גביו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗