GPT
J

jobs

קוד פתוח

unslothרישיון לא דווח2026-01-20

  • uv-script
  • unsloth
  • training
  • hf-jobs
  • vlm

זה לא מאגר נתונים לאימון אלא אוסף סקריפטים של פייתון להרצת אימוני מודלים בענן. מי שמחפש קוד מוכן להרצה מהירה של כוונון עדין על גבי תשתית מנוהלת ימצא כאן נקודת פתיחה ישירה.

  • 111הורדות בחודש
  • 56לייקים

מה זה

המאגר מכיל שישה קבצים בלבד, שרובם סקריפטים מבוססי מנהל החבילות uv להרצה ישירה דרך שירות המחשוב של האגינג פייס. אין כאן שורות מידע, טקסטים או תמונות משל עצמו. מטרת הקבצים היא למשוך נתונים חיצוניים ולבצע אימון באמצעות ספריית אנסלות'.

הקוד מחולק לפי משימות וארכיטקטורות ספציפיות. יש סקריפט לכוונון מודל שפה קטן מסוג LFM2.5, סקריפטים לכוונון מודלי ראייה ושפה על בסיס Qwen3-VL ו־Gemma 3, וסקריפט נוסף המיועד להמשך אימון מקדים על גבי Qwen3 באמצעות טקסט גולמי. הנתונים שהסקריפטים מצפים לקבל צריכים להגיע ממאגרים אחרים בפורמטים מוגדרים מראש כמו מבנה שיחה או עמודות תמונה וטקסט.

מתאים ל

  • אימון מודל שפה קטן

    הרצת כוונון עדין על LFM2.5-1.2B בענן בעזרת דאטהסט שיחות חיצוני.

  • כוונון מודל מולטימודלי

    אימון Qwen3-VL או Gemma 3 על מאגר הכולל תמונות ושיחות ללא תשתית מקומית.

  • המשך אימון מקדים

    התאמת מודל Qwen3 לתחום ידע ייעודי באמצעות הזנת קורפוס טקסט חיצוני.

איפה זה נופל

הבעיה העיקרית היא שהמאגר מקוטלג כדאטהסט אף על פי שאין בו גרם של מידע לאימון. אם חיפשתם נתונים בעברית, דוגמאות שיחה או חומר להערכת ביצועים, תצטרכו להביא אותם ממקור אחר לגמרי. בנוסף, הסקריפטים מותאמים למספר מצומצם מאוד של מודלי בסיס כמו LFM או Qwen, ותומכים במבני קלט קשיחים למדי. אין פה תיעוד על מגבלות אתיות, איכות או סינון, פשוט כי אין תוכן לסנן.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. המאגר מכיל רק קוד פייתון ולא כולל טקסטים או דוגמאות אימון כלל. אם תרצו לאמן בעברית, תצטרכו לחבר סקריפט מפה לדאטהסט חיצוני בעברית.

האם מותר להשתמש בקוד לפרויקט מסחרי?

לא דווח רישיון למאגר הזה. בהיעדר רישיון פתוח מוצהר, אין הרשאה משפטית ברורה להשתמש בקוד, להעתיק אותו או להסתמך עליו לפיתוח מוצרים מסחריים.

כמה המאגר שוקל וכמה שורות נתונים יש בו?

המאגר שוקל קילובייטים בודדים כי הוא כולל שישה קבצים, בעיקר סקריפטי פייתון וקובץ הסבר. אין בו שורות של דאטה או רשומות שמיועדות ללמידת מכונה.

איך מריצים את הקבצים בפועל?

משתמשים בכלי השורת פקודה של האגינג פייס עם פקודת הרצה של uv ישירות מול הכתובת של הסקריפט ברשת. מעבירים טוקן אישי, סוג מעבד גרפי בענן ואת המאגר החיצוני שבו נמצא המידע שלכם.

איך טוענים

לא טוענים את המאגר הזה באמצעות פקודות קריאת נתונים רגילות בפייתון. במקום זאת, מריצים את הסקריפטים ישירות מהרשת דרך כלי השורת פקודה של האגינג פייס יחד עם uv, ללא צורך בהתקנה מקומית מוקדמת. בזמן ההרצה צריך להעביר פרמטרים חובה: מזהה של דאטהסט חיצוני שיושב בהאגינג פייס ושם המאגר שבו יישמר המודל המאומן. הקוד דורש חשבון מאומת ומפתח גישה, ומנהל בעצמו את התקנת התלויות הנדרשות על גבי מעבדי הענן.

from datasets import load_dataset

ds = load_dataset("unsloth/jobs")

הרישיון

היוצרים לא הגדירו רישיון שימוש במאגר. מבחינה חוקית, קוד ללא רישיון מוגדר מראש נשאר תחת זכויות יוצרים מלאות של הכותבים, כך שאין היתר מפורש להשתמש בו לצרכים מסחריים, לשנות אותו או להפיץ אותו מחדש. לפני שמשלבים את הסקריפטים בתהליכי עבודה פנימיים או מייצרים מהם מודלים מסחריים, צריך לקחת בחשבון את הסיכון המשפטי בהיעדר תנאי שימוש ברורים.

הרישיון המלא ב־Hugging Face ↗