GPT
O

opc-fineweb-code-corpus

קוד פתוח

OpenCoder-LLMmit2024-11-09

המאגר מרכז דפי רשת שקשורים לתכנות מתוך FineWeb, שנשלפו בסינון מיוחד עבור אימון מקדים. הוא מיועד למי שבונה מודל קוד וצריך טקסט טכני מהרשת ולא רק קבצי מקור ממאגרים.

  • 3,472הורדות בחודש
  • 56לייקים

מה זה

המאגר כולל עמודי רשת שנאספו מתוך פרויקט FineWeb וסווגו כבעלי זיקה לתכנות ולקוד. במקום לקחת קוד ישיר מגיטהאב, החומר כאן מורכב מטקסט רשת חופשי שעוסק בפיתוח, כמו תיעודים, דיונים טכניים, מאמרי הדרכה והסברים שנמצאו ברשת הפתוחה. הנתונים האלה שימשו לאימון המקדים של משפחת מודלי OpenCoder, במטרה לתת למודל הבנה רחבה יותר על הקשרים סביב שורות הקוד עצמן.

הסינון בוצע באמצעות מודל fastText בשלושה סבבים איטרטיביים שנועדו לאתר ולשלוף את העמודים הרלוונטיים מתוך המאגר המקורי. בסך הכל התהליך הניב כחמישים וחמישה מיליארד טוקנים של מידע שמחולק לקוד ולמתמטיקה, כאשר החלק המתמטי פוצל למאגר נפרד והחלק הזה מתמקד כולו בעמודי קוד. הרשומות מאורגנות בתוך חלוקת אימון רחבה שמופצת בקבצים דחוסים, ללא חלוקה מוגדרת מראש למבחן או אימות בעמוד עצמו.

מתאים ל

  • אימון מקדים למודלי קוד

    הזנת טקסט טכני והסברי רשת למודל שפה בשלב ה־Pre-training לצד קוד מקור.

  • בניית מסווגי תוכן טכני

    שימוש ברשומות כבסיס לזיהוי דפי רשת שקשורים לפיתוח תוכנה.

  • מחקר על סינון נתונים

    בדיקת איכות השליפה של fastText מתוך מאגרי ענק כמו FineWeb.

איפה זה נופל

הכרטיס לא מפרט את סכמת הנתונים, שמות השדות המדויקים, או את השפות האנושיות שמופיעות בטקסטים. מאחר שהמקור הוא FineWeb והסינון נעשה על ידי מסווג fastText, צפויות דליפות של עמודי זבל שלא סוננו היטב או טקסטים שרחוקים מלהיות קוד איכותי. אין כאן מידע על תאריכי האיסוף המדויקים או התפלגות שפות תכנות, ולכן תצטרכו לדגום קבצים בעצמכם כדי לוודא שהאיכות תואמת לצרכים שלכם.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

כרטיס המאגר לא מפרט את התפלגות השפות. מכיוון שמקורו ב־FineWeb הכללי, הרוב המוחלט של הטקסטים הוא באנגלית, אך ייתכנו מופעים זניחים של שפות אחרות.

האם מותר להשתמש במידע כדי לבנות מוצר מסחרי?

כן, הרישיון המדווח הוא MIT. הוא מאפשר שימוש מסחרי, שינוי והפצה, כל עוד נותנים קרדיט ושומרים על נוסח הרישיון.

מה ההבדל בין המאגר הזה למאגר המתמטיקה של הפרויקט?

היוצרים חילקו את הפלט של סינון fastText לשניים. המאגר הזה מכיל עמודי רשת העוסקים בקוד, בעוד שתוכן מתמטי הופרד למאגר ייעודי בשם fineweb-math-corpus.

איך נאספו הנתונים מהרשת?

העמודים נשלפו מתוך מאגר FineWeb הקיים. השליפה התבצעה באמצעות שלושה סבבים של מודל fastText שנועד לאתר עמודים רלוונטיים לתכנות.

איך טוענים

הנתונים מחולקים ל־511 קובצי parquet שונים בתיקיית המידע של המאגר. אפשר לטעון אותו ישירות דרך ספריית datasets בלי צורך לבקש אישור גישה מוקדם, כי המאגר פתוח לציבור. קחו בחשבון שמדובר במאות קבצים גדולים שמיועדים לאימון מקדים, אז עבודה עם הזרמת נתונים או הורדה מקומית לשרת ייעודי היא הדרך ההגיונית היחידה לגשת אליו.

from datasets import load_dataset

ds = load_dataset("OpenCoder-LLM/opc-fineweb-code-corpus")

הרישיון

הרישיון המדווח בעמוד הוא MIT, מה שאומר שמותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו באימונים בלי חובת שיתוף זהה. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של היוצרים. עבור מודל שמאומן על הדאטה, רישיון כזה נותן חופש מסחרי מלא.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗