GPT
L

Llama3-8B-Chinese-Chat-GGUF-8bit

קוד פתוח

shenzhi-wangllama32024-04-23

  • transformers
  • gguf
  • llama
  • text-generation
  • llama-factory

גרסה מכווצת בשמונה ביט של מודל Llama 3 שעברה התאמה לסינית ואנגלית. היא מיועדת למי שצריך תמיכה טובה בסינית בלי ערבוב מילים מאנגלית, בהרצה מקומית קלה.

  • 8,192טוקנים בהקשר
  • 8.0 GBמשקל הקבצים
  • 1,157הורדות בחודש
  • 166לייקים

מה זה

הפרויקט הזה לוקח את Meta-Llama-3-8B-Instruct ומכוון אותו באמצעות שיטת ORPO עם כ־100 אלף זוגות העדפה. המטרה המרכזית הייתה לפתור בעיה מוכרת במודל המקורי, שבה שאילתות בסינית נענו באנגלית או בפלט מעורב ומקוטע. כאן מקבלים קובץ בכימות q8_0 שתופס כשמונה גיגה-בייט, עם חלון הקשר של 8,192 טוקנים.

הגרסה הזו מוגדרת כ־v2.1, והאימון שלה הורחב פי חמישה בהשוואה לגרסה הראשונה. הדגש הושם על משחקי תפקידים, הפעלת פונקציות וחישובים מתמטיים. אין בכרטיס המודל ציוני בנצ'מרק מספריים, אבל מובאות בו דוגמאות שיחה שמראות פלט JSON תקין לקריאת כלים, פתרון בעיות מילוליות בחשבון, והתמודדות סבירה עם שאלות היגיון והתחכמויות בסינית.

מתאים ל

  • צ'אט בוט דו לשוני

    מענה מדויק בסינית תקנית ובאנגלית ללא שילוב לא רצוי של שפות שונות.

  • קריאות פונקציה מקומיות

    חילוץ פרמטרים והחזרת מבני JSON לקריאת כלים חיצוניים במכונה פרטית.

  • משחקי תפקידים בסינית

    אימון ייעודי על דיאלוגים מותאמים אישית וסגנונות כתיבה מגוונים בשפה הסינית.

איפה זה נופל

היוצרים מדגישים שהם נמנעו במכוון מאימון על זהות המודל כדי לא לפגוע ביכולות הכלליות שלו. המשמעות היא ששאלות ישירות על מי יצר אותו יובילו להזיות ולתשובות אקראיות לחלוטין. מעבר לכך, התמיכה המוצהרת היא באנגלית ובסינית בלבד, כך שלא כדאי לבנות עליו לעיבוד עברית, שכן אוצר המילים והאימון פשוט אינם מכסים אותה בצורה שמישה.

אותה משפחה

Llama3-8B-Chinese יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל אומן והותאם ספציפית לסינית ולאנגלית בלבד. הוא לא עבר אימון ייעודי בעברית, ולכן פלט בעברית יהיה לא אמין, איטי ונוטה לטעויות כבדות.

איזו חומרה צריך כדי להריץ את גרסת ה־q8_0?

הקובץ שוקל שמונה גיגה-בייט, ולכן מומלץ כרטיס מסך עם לפחות 12GB VRAM להרצה חלקה בזיכרון הגרפי. אפשר להריץ אותו גם על זיכרון RAM רגיל באמצעות מעבד, אך קצב התגובה יהיה נמוך משמעותית.

מה ההבדל המרכזי בין v2.1 לגרסאות המוקדמות?

גרסה 2.1 אומנה על מאגר נתונים גדול פי חמישה מגרסה 1, הכולל כמאה אלף זוגות העדפה. היא מצמצמת את זליגת המילים באנגלית לתוך טקסט סיני ומשפרת את היכולת במתמטיקה ובמשחקי תפקידים.

איך מריצים

בשביל להריץ את גרסת ה־8-bit הזו צריך זיכרון וידאו של כעשרה עד שנים-עשר גיגה-בייט כדי לטעון את כל 32 השכבות לכרטיס מסך אחד. מי שמשתמש במחשב אישי עם מעבד וזיכרון RAM רגיל יכול להריץ אותה דרך llama.cpp או Ollama עם פקודה ישירה למודל, אך ירגיש ירידה בקצב הפקת הטוקנים. אם הזיכרון לחוץ, קיימת גם גרסת q4_0 קלה יותר באותו מאגר.

אם אין לכם כרטיס מתאים או שהמטרה היא רק ניסוי קצר, הפעלת שרת ייעודי מקומי עם קבצים של שמונה גיגה פחות משתלמת, ועדיף לבדוק את הדמו הקיים ברשת.

ollama run hf.co/shenzhi-wang/Llama3-8B-Chinese-Chat-GGUF-8bit:Q8_0

הקבצים

5 קבצים במאגר, 8.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון llama3 המקורי של מטא. הוא מאפשר שימוש מסחרי חופשי כל עוד לחברה אין יותר מ־700 מיליון משתמשים פעילים חודשיים ביום ההשקה. השימוש מחייב שמירה על תנאי השימוש המקובלים של מטא ומדיניות הבטיחות שלהם.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗