GPT
D

Dolci-Instruct-SFT

קוד פתוח

allenaiodc-by2025-11-18

אוסף של מעל שני מיליון הוראות ששימש לאימון הדגם Olmo 3 7B. הוא מרכז פקודות קוד, מתמטיקה, היגיון ובטיחות ממקורות מובילים שעברו סינון איכות קפדני.

  • 3,317הורדות בחודש
  • 60לייקים

מה זה

המאגר כולל 2,152,112 דוגמאות שנאספו מתערובת רחבה של מקורות קיימים וחדשים. בין המקורות תמצאו חלקי נתונים מתוך Tulu 3 שמתמקדים במתמטיקה, אלגברה וקוד פייתון, לצד דאטהסטים כמו OpenThoughts 3 שעבר דגימה מחדש והסרת עקבות חשיבה, FLAN v2, Evol CodeAlpaca ונתוני בטיחות מתוך WildGuardMix ו־WildJailbreak.

בנוסף שולבו נתונים ייעודיים שנבנו עבור הפרויקט. אלה כוללים מעל שלוש מאות אלף דוגמאות מחשבה מאומתת, מאגר חידות היגיון, תרגול אלגוריתמים בפייתון, שימוש בכלים ושיחות מתוך WildChat שחודשו עם תשובות מדגם GPT-4.1. הכמויות קטנות יותר מהמקורות המקוריים בגלל סינון איכות יזום ובקשות שנחסמו בממשק של Azure.

מתאים ל

  • אימון הוראות כללי

    מתאים למי שרוצה לאמן מודל בסיס לביצוע פקודות מורכבות, פתרון בעיות ושיחה טבעית.

  • חיזוק יכולות קוד וחשיבה

    האוסף מכיל מאות אלפי שאלות תכנות בפייתון, חידות היגיון ודוגמאות חשיבה מאומתת.

  • כוונון לשימוש בכלים ובטיחות

    מעל מאתיים אלף פקודות הפעלת כלים לצד דוגמאות ייעודיות לזיהוי מתקפות ועקיפת מגבלות.

איפה זה נופל

עברית כמעט בוודאות לא קיימת כאן. רשימת השפות כוללת בעיקר ניבים שונים של ערבית, דנית, גרמנית, יוונית ושפות נוספות, אך לא עברית, כך שלא הייתי בונה עליו לאימון מודל מקומי. חלק מהדוגמאות מסתמכות על תשובות סינתטיות שנוצרו על ידי GPT-4.1, ולפי התיעוד חלק מהבקשות נחסמו על ידי מסנני Azure, מה שעלול ליצור הטיות לא מתועדות בכיסוי הנושאים.

אותה משפחה

Dolci יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

לא. רשימת השפות המדווחת כוללת מספר ניבים של ערבית, יוונית, גרמנית, דנית ושפות אחרות, אך עברית אינה מופיעה בה. לא הייתי מסתמך עליו כדי ללמד מודל לתקשר בעברית.

האם מותר להשתמש בו לאימון מסחרי?

רישיון ODC-BY כשלעצמו מתיר שימוש חופשי תמורת מתן קרדיט. עם זאת, המכון מצהיר על כוונה לשימוש מחקרי וחינוכי, וחלק מהתשובות נוצרו באמצעות GPT-4.1, מה שמחייב בדיקה משפטית מול תנאי השימוש של יוצרי אותם מודלים.

מאיפה הגיעו הנתונים?

מדובר בהרכבה של מקורות קיימים כמו Tulu 3, FLAN v2, Aya ו־OpenThoughts 3, יחד עם נתונים חדשים שנוצרו עבור הפרויקט. התוכן החדש כולל חידות, אלגוריתמים בפייתון ותשובות מחודשות מתוך WildChat.

למה חלק מהמאגרים המקוריים קוצצו כאן?

המפרסמים מסבירים שהכמויות קטנות יותר ממקורות האם בגלל סינון קפדני יותר שהופעל על איכות המידע. בנוסף, חלק מהבקשות נחסמו במהלך היצירה על ידי מנגנוני הסינון של ממשק ה־API ב־Azure.

איך טוענים

הנתונים מחולקים לשישה עשר קבצי Parquet שממוספרים מ־00000 עד 00015 תחת תיקיית data. אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה דרך ספריית datasets. המשקל הכולל לא צוין בכרטיס, אך מדובר במיליוני רשומות כך שנדרש מקום פנוי מתאים בדיסק וסביבת עבודה שמסוגלת לקרוא קבצי Parquet בחלקים.

from datasets import load_dataset

ds = load_dataset("allenai/Dolci-Instruct-SFT")

הרישיון

המאגר מפורסם תחת רישיון ODC-BY. מותר להשתמש בנתונים, לשנות אותם ולהפיץ אותם, כולל אימון מודלים, כל עוד אתם נותנים קרדיט ברור ליוצרים. עם זאת, המפרסמים מציינים כוונה לשימוש מחקרי וחינוכי בכפוף להנחיות השימוש האחראי של המכון, וכדאי לקחת בחשבון שחלק מהתשובות נוצרו במקור על ידי מודלים מסחריים סגורים.

הרישיון המלא ב־Hugging Face ↗