GPT
R

react-code-instructions

קוד פתוח

cfahlgren1mit2024-08-26

המאגר מרכז הוראות וקוד לבניית יישומי React בסגנון הארטיפקטים של קלוד. המטרה כאן היא לאמן מודלים לייצר אפליקציות ווב שלמות ואינטראקטיביות מבוססות פרומפטים.

  • 1,441הורדות בחודש
  • 158לייקים

מה זה

המאגר כולל דוגמאות של יישומי React מלאים שנוצרו באמצעות בינה מלאכותית, בסגנון הרכיבים העצמאיים שקלוד מציג בממשק שלו. הדוגמאות בעמוד מציגות ממשקים מוכרים כמו שיבוט של לינקדאין, מחשבון של אייפון, חנות של אפל, אתר לאימון כושר ומערכת רשימת המתנה. לא מדובר בקטעי קוד בודדים אלא באפליקציות שלמות שכוללות עיצוב, מבנה ואינטראקציה.

כל המידע כאן הוא סינתטי לחלוטין. הוא יוצר באמצעות שילוב של שלושה מודלי שפה שונים: Llama 3.1 70B, גרסת הענק Llama 3.1 405B, ומודל Deepseek Chat V3. המודלים האלה קיבלו הנחיות ופלטו את הקוד המתאים, כך שהרשומות משקפות ישירות את היכולות ואת הסגנון של המודלים שיצרו אותן.

התוכן עצמו מחולק למספר קובצי jsonl במאגר, כולל קובץ ספציפי של רשומות ייחודיות לצד קבצים עם מזהים שונים. הכרטיס אינו מפרט תהליך סינון ידני או אוטומטי שנעשה על הקוד, ומלבד שאילתות שמציגות חלוקה לפי מודל או תאריך הוספה, אין פירוט על חלוקה מסודרת לאימון ולבדיקה.

מתאים ל

  • אימון מודלים לייצור ממשקים

    כיוונון עדין של מודלי שפה כדי שיידעו לפלוט יישומי React שלמים מתוך תיאור טקסטואלי.

  • הערכת יכולות קוד

    בדיקה והשוואה של איכות הקוד שפולטים מודלים שונים מול דוגמאות קיימות.

  • מחקר על דאטה סינתטי

    ניתוח ההבדלים בסגנון הקוד וההוראות בין Llama 3.1 לבין Deepseek Chat V3.

איפה זה נופל

כל הנתונים סינתטיים ונוצרו על ידי מכונות, בלי שום תיעוד על בדיקות תקינות, הרצה או בדיקות קומפילציה שנעשו לקוד. אין בכרטיס שום מידע על תמיכה בעברית או יישור לימין, והפרויקטים המוצגים כולם באנגלית. אם אתם בונים מודל שמיועד לייצר קוד אמיתי, קחו בחשבון שדאטה סינתטי של מודלים עשוי להכיל שגיאות תחביר, הזיות של ספריות חיצוניות או שיטות עבודה לא מעודכנות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT ולכן אין מגבלה על שימוש מסחרי בקוד או אימון מודלים מסחריים לפיו. יש לצרף את הודעת הרישיון המקורית כנדרש.

האם יש בדאטהסט תמיכה בעברית?

הכרטיס אינו מציין תמיכה בשפות אחרות, וכל הדוגמאות המוצגות הן באנגלית בלבד. אם המטרה היא ממשקים בעברית עם RTL, תצטרכו להוסיף דאטה משלכם.

מאיפה הגיעו הנתונים שבפנים?

הנתונים נוצרו באופן מלאכותי לחלוטין על ידי שלושה מודלים: Llama 3.1 70B, Llama 3.1 405B ו־Deepseek Chat V3. לא מדובר בקוד שנאסף ממאגרים ציבוריים של מפתחים אמיתיים.

האם הקוד נבדק ונמצא עובד?

בדף המאגר אין שום תיעוד של בדיקות הרצה, לינטר או ולידציה על הקוד שנוצר. לפני שמכניסים את החומר לאימון, חובה לדגום ולבדוק שהרכיבים אכן מתקמפלים בלי תקלות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה cfahlgren1/react-code-instructions. הגישה פתוחה לחלוטין ואין צורך לבקש אישור או להגדיר טוקן מיוחד. הקבצים שמורים בפורמט jsonl בתוך תיקיית data, כשהקובץ data_uniques.jsonl מרכז כנראה את הדוגמאות ללא כפילויות. לפי השאילתות בעמוד המאגר, המידע בנוי במבנה של הודעות עם שדות למודל שיצר את התוכן, מה שמאפשר לסנן לפי מודל ספציפי.

from datasets import load_dataset

ds = load_dataset("cfahlgren1/react-code-instructions")

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן מודלים ללא הגבלה, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗