GPT
D

Dolci-Think-SFT-7B

קוד פתוח

allenaiרישיון לא דווח2025-10-16

המאגר מרכז מעל שני מיליון פרומפטים לאימון מודלי חשיבה עם תגיות ייעודיות. הוא נועד למי שרוצה ללמד מודל קוד פתוח להסביר את צעדי ההיגיון שלו לפני התשובה הסופית.

  • 6,161הורדות בחודש
  • 19לייקים

מה זה

מדובר באוסף מסיבי של שיחות שמיועד לשלב האימון המונחה עבור מודלים חושבים. הרשומות מגיעות משילוב של מקורות קיימים כמו OpenThoughts 3 שהורחב להקשר של 32K, נתוני קוד מ־Nemotron ופרומפטים סינתטיים מ־SYNTHETIC-2, לצד נתונים חדשים שצוות המכון יצר סביב כתיבת קוד פייתון ומעקב אחר הוראות מורכבות.

חלק משמעותי נוסף נשען על שאילתות ממאגרי Tülu 3 ו־OLMo 2, כולל WildChat, Aya, ו־WildJailbreak. עבור השאילתות האלה יצרו עקבות חשיבה חדשים באמצעות DeepSeek R1. לפי התיעוד, כמות הדגימות מהמקורות הוותיקים קטנה יותר מבמקור בגלל סינון איכות קפדני ובקשות שנחסמו על ידי המנגנונים של Azure API.

מתאים ל

  • אימון מודלי היגיון

    לימוד מודל בסיס לייצר שלבי מחשבה מפורטים לפני שליפת תשובה בבעיות מורכבות.

  • הוראות מרובות תנאים

    אימון המערכת להיצמד להגבלות מחמירות ודרישות עימוד מדויקות לאורך שיחה.

  • כתיבה ותיקון קוד

    הטמעת מאות אלפי דוגמאות פייתון לשיפור יכולות תכנות והסבר פתרונות.

  • בדיקת גבולות בטיחות

    שימוש ברשומות מתקפות וסינון כדי למדוד עמידות של מודל מול ניסיונות עקיפה.

איפה זה נופל

חלק משמעותי משרשראות החשיבה כאן יוצר באמצעות מודלים של DeepSeek, מה שאומר שהפלט כולל הטיות וטעויות היגיון טיפוסיות למודלי שפה סינתטיים. הסינון דרך ה־API של Azure חסם נושאים מסוימים, מה שיצר חורים בכיסוי התכנים. המאגר כולל דגימות בטיחות מ־WildJailbreak ו־WildGuardMix, אבל הן לא מבטיחות שהמודל שלכם יהיה מוגן בלי בדיקות מעמיקות משלכם. בנוסף, למרות נוכחות של נתונים מ־Aya, הרוב המוחלט של התוכן ממוקד באנגלית וקוד, כך שאין כאן מענה רציני לדקויות או ידע מקומי בעברית.

אותה משפחה

Dolci-Think יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הכרטיס הראשי לא מציג רישיון פורמלי, אך בטקסט עצמו מוזכר רישיון ODC-BY לצד הפניה להנחיות השימוש האחראי של Ai2. במקביל, הנתונים מורכבים ממקורות שונים ברישיונות Apache 2.0, MIT ופלט של DeepSeek. בגלל הערבוב הזה, שימוש מסחרי מחייב בדיקה משפטית של שרשרת הזכויות לפני שמשקיעים משאבי אימון.

איך מובנה המידע בכל דוגמה?

כל שורה במאגר מכילה מזהה, את שם המקור שממנו נלקח המידע, ורשימת הודעות סטנדרטית לאימון מונחה. תשובת המודל כוללת תמיד את תהליך ההיגיון עטוף בתגיות חשיבה ספציפיות. התשובה הגלויה מגיעה ישירות אחרי סגירת תגית החשיבה ללא תיוג נוסף.

האם יש בדאטהסט הזה תוכן בעברית?

המאגר כולל כמעט מאה אלף דגימות מתוך פרויקט Aya שמכיל נתונים רב-לשוניים, אך הכרטיס אינו מפרט את פילוח השפות המדויק. החלק הארי של המאגר מורכב מקוד פייתון, פרומפטים מ־OpenThoughts ושאילתות באנגלית. מודל שיאומן עליו בלבד לא יקבל יכולות חשיבה עמוקות בשפה העברית.

מאיפה הגיעו נתוני החשיבה החדשים?

חלק מהנתונים נבנו מחדש באמצעות שימוש בפרומפטים מוכרים ממאגרי WildChat, Guanaco ואחרים, שעבורם נוצרו עקבות מחשבה באמצעות DeepSeek R1. חלקים נוספים, בעיקר בתחום התכנות ומעקב אחר הוראות מורכבות, נוצרו ישירות על ידי צוות המכון בשילוב שיטות אימות ייעודיות.

איך טוענים

הנתונים מחולקים ל־157 קובצי parquet בתוך תיקיית data, כך שאין צורך באישור גישה מיוחד כדי להתחיל להוריד. הטעינה נעשית ישירות דרך ספריית datasets הרגילה של Hugging Face. המבנה של כל רשומה כולל מזהה ייחודי, שדה מקור שמציין מאיזה מאגר השורה נלקחה, ומערך הודעות בפורמט צ'אט סטנדרטי. בתוך תשובת העוזר מופיע תמיד בלוק חשיבה תחום בתגיות ייעודיות, והתשובה הסופית מגיעה מיד אחריו בלי תגיות נוספות.

from datasets import load_dataset

ds = load_dataset("allenai/Dolci-Think-SFT-7B")

הרישיון

בכרטיס הראשי לא מוגדר רישיון רשמי, אך בגוף הטקסט הצוות מציין שימוש ברישיון ODC-BY המאפשר שימוש ומחקר בכפוף לייחוס והנחיות השימוש של Ai2. עם זאת, חלקים נרחבים מהמאגר מבוססים על נתונים ברישיונות אחרים כמו Apache 2.0, MIT, ו־CC BY 4, לצד תוצרי זיקוק מ־DeepSeek. הערבוביה הזו דורשת בדיקה משפטית זהירה אם אתם שוקלים להכניס מודל מאומן למוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗