GPT
I

imatrix-calibration

קוד פתוח

eaddariomit2025-01-29

נתוני כיול מוכנים ליצירת מטריצות חשיבות בכימות מודלים עם LLaMA C++. המאגר חוסך איסוף ידני ומציע חלוקה לנושאים, שפות וגדלים מוגדרים מראש.

  • 7,392הורדות בחודש
  • 64לייקים

מה זה

המאגר מכיל פרומפטים שעברו ניקוי והסרת כפילויות, ומיועדים להרצה מול כלי הכיול של llama.cpp כדי למזער שגיאות כימות. הנתונים מחולקים למספר תחומים מרכזיים: קוד, מתמטיקה, הפעלת כלים וטקסט כללי. כל תחום מגיע בשש רמות גודל שנעות בין micro של אלפי שורות בודדות לבין huge שמגיע לעד 200,000 שורות. בנוסף ישנם קבצים משולבים שמערבבים מתמטיקה וקוד, או שילובים של כלים, מתמטיקה ושפה ספציפית.

מקורות הנתונים מגוונים ומתבססים על דאטהסטים קיימים ומוכרים. נתוני הקוד נלקחו ממאגרים כמו Open-Critic-GPT ו־Magicoder-Evol-Instruct-110K, תחום המתמטיקה מבוסס על OpenMathInstruct-2 של nvidia, וקריאות הכלים נאספו מ־BitAgent ו־Efficient_ToolCalling. הטקסטים הלשוניים מכסים 18 שפות ונשענים על FineWeb, FineWeb-2 ו־Common Crawl, כשיש גם קבצים מקובצים לפי משפחות שפות כמו שפות גרמאניות, רומאניות או שפות אירופאיות.

מתאים ל

  • כיול כימות לקוד

    הרצת llama-imatrix על קובצי הקוד כדי לשמור על דיוק תחבירי בכימות מודלים לתכנות.

  • כיול רב לשוני

    שימוש בקובצי שפות ספציפיות כמו ערבית או ספרדית לשמירה על ביצועי המודל בשפה מוגדרת.

  • שמירה על יכולות כלים

    כיול באמצעות נתוני ה־tools כדי למנוע שיבוש בתחביר קריאות לפונקציות תחת קוונטיזציה נמוכה.

איפה זה נופל

אם אתם בונים מודל שמיועד לעבוד בעברית, המאגר הזה לא יעזור לכם. עברית לא נכללת ברשימת 18 השפות, ולכן כיול מודל רב לשוני שכולל עברית באמצעות הקבצים האלה עלול לפגוע באיכות השפה המקומית בכימות אגרסיבי. בנוסף, נתוני הקוד, המתמטיקה והכלים קיימים באנגלית בלבד, כך שאין כאן מענה לפקודות קוד או חישוב בשפות אחרות. הנתונים מתאימים בעיקר לכיול ופחות לאימון מלא.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא. המאגר מכיל 18 שפות שונות ביניהן ערבית, אנגלית, צרפתית, גרמנית ורוסית, אך עברית אינה מופיעה בו.

מותר להשתמש בזה למודל מסחרי בחברה?

כן. הרישיון המוגדר הוא MIT, שמאפשר שימוש מסחרי חופשי לחלוטין ללא דרישה לחשוף את הקוד שלכם.

למה אי אפשר לטעון את הקבצים ישירות ל־llama.cpp?

הכלי llama-imatrix תומך בקלט טקסטואלי רגיל בלבד ולא בפורמט Parquet. יש לחלץ את עמודת content לקובץ txt באמצעות כלי כמו DuckDB.

מה ההבדל בין הגדלים השונים כמו micro לעומת huge?

ההבדל מתבטא בכמות השורות והטוקנים. קובצי micro מכילים אלפי שורות בודדות ומיועדים לכיול מהיר, בעוד קובצי huge מגיעים למאות אלפי שורות ולמיליוני טוקנים לכיול יסודי יותר.

איך טוענים

אין צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה ומכיל 302 קבצים בפורמט Parquet. כלי ה־imatrix של llama.cpp לא יודע לקרוא קובצי Parquet ישירות וחייב טקסט נקי. תצטרכו להמיר את הקובץ לטקסט לפני ההרצה, למשל באמצעות שליפת שדה ה־content בעזרת DuckDB ושמירתו לקובץ txt פשוט.

from datasets import load_dataset

ds = load_dataset("eaddario/imatrix-calibration")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו בפרויקטים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית של הרישיון. שימוש בקבצים לכיול מודל מסחרי אינו כובל את המודל עצמו בתנאי רישוי מגבילים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗