GPT
L

LLaMA3-iterative-DPO-final-GGUF

קוד פתוח

bartowskillama32024-05-14

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת של מודל שעבר אימון DPO איטרטיבי על בסיס לאמה 3. פתרון מתאים למי שרוצה להריץ מודל שיחה מכוונן היטב מקומית על מחשב אישי.

  • 113 GBמשקל הקבצים
  • 1,612הורדות בחודש
  • 73לייקים

מה זה

מדובר בהמרה של המודל המקורי מבית RLHFlow לפורמט llama.cpp באמצעות שחרור b2854, עם כיול imatrix שמטרתו לשמור על דיוק המשקלים גם בכיווץ אגרסיבי. הבסיס הוא מודל שיחה שאומן בשיטת DPO איטרטיבית, תהליך שנועד לחדד את היכולת לעקוב אחר הוראות מורכבות ולייצר תשובות עקביות יותר בהשוואה לכוונון ישיר רגיל.

המפרסם ארז כאן מגוון רחב מאוד של גרסאות קוונטיזציה, החל ממשקלים מלאים כמעט של שמונה ביט ועד גרסאות דחוסות במיוחד של פחות משני ביט. אין בדף המודל תוצאות מבחנים מספריות ספציפיות, כך שקשה לדעת בדיוק כמה נקודות הוא מקבל במדדים מקובלים מול גרסאות מתחרות, אבל מגוון הכיווצים מאפשר להתאים אותו במדויק לחומרה הקיימת.

מתאים ל

  • עוזר שיחה מקומי

    מאפשר הרצת צ'אט פרטי לגמרי על חומרת קצה ללא שליחת מידע לשרתים חיצוניים.

  • מעקב אחר הוראות מורכבות

    אימון ה־DPO האיטרטיבי עוזר לקבלת תשובות מדויקות שמצייתות למבנה הפרומפט.

  • בדיקות על מכונות חלשות

    מגוון גרסאות ה־IQ מאפשר להריץ מודל שפתי גם על כרטיסי מסך ישנים ומוגבלי זיכרון.

איפה זה נופל

היוצר מציין במפורש שגרסאות הקידוד הנמוכות מאוד, כמו IQ1_M או IQ1_S ששוקלות סביב שני גיגהבייט, מציעות איכות ירודה במיוחד והוא לא ממליץ להשתמש בהן. מעבר לכך, גרסאות מסוג IQ אינן תואמות להרצה מעל וולקן, מה שמגביל משתמשים עם כרטיסי מסך מסוימים.

הכרטיס לא מציג נתונים על תמיכה בעברית, כך שיש סיכוי סביר שהמודל יתקשה ביצירת טקסט עברי שוטף או מדויק. אין כאן נתוני השוואה או מדדי בנצ'מרק, לכן חובה לבדוק את התשובות על משימות ספציפיות לפני שמשלבים אותו במערכת עובדת.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

עבור רוב השימושים על גבי מחשב עם כרטיס מסך מודרני, גרסת Q4_K_M במשקל 4.92 גיגהבייט נותנת את האיזון הטוב ביותר בין מהירות, גודל ואיכות. אם יש לכם מספיק זיכרון גרפי, גרסת Q6_K תיתן תוצאה מדויקת עוד יותר כמעט ללא איבוד מידע.

האם המודל יעבוד טוב בעברית?

הכרטיס לא מציין אימון ייעודי לעברית, ומודלי הבסיס מסדרה זו מתמקדים בעיקר באנגלית. סביר להניח שהוא יבין עברית בסיסית, אך עלול לכתוב בתחביר מאולץ או לטעות לעיתים קרובות.

איך מריצים

אתם מורידים קובץ בודד בפורמט gguf דרך huggingface-cli ומריצים אותו ישירות מעל llama.cpp או כלים תואמים. בשביל ביצועים טובים, גודל הקובץ צריך להיות קטן בגיגהבייט או שניים מסך הזיכרון הגרפי הזמין, כך שהמודל יישב כולו בתוך הוידאו ראם של הכרטיס.

גרסת Q4_K_M שוקלת 4.92 גיגהבייט ומתאימה לרוב הכרטיסים עם שמונה גיגהבייט זיכרון. אם המטרה היא דיוק מקסימלי, קובץ Q6_K שוקל 6.59 גיגהבייט ומספק איכות קרובה מאוד למקור, בעוד שגרסאות IQ מתאימות למי שנדחק לתקציבי זיכרון נמוכים במיוחד ומשתמש בכרטיסי אנבידיה או איי אם די תחת קימפול מתאים.

ollama run hf.co/bartowski/LLaMA3-iterative-DPO-final-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא llama3 של חברת מטא. הרישיון מאפשר שימוש מסחרי ומחקר, אך כפוף למגבלות המקוריות של מטא, כולל תנאי שימוש הוגן וסייגים שנוגעים למספר המשתמשים הפעילים בחודש אם המוצר מגיע להיקפי ענק.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗