GPT
L

Llama3.1-8B-Chinese-Chat

קוד פתוח

shenzhi-wangllama3.12024-07-24

  • transformers
  • safetensors
  • gguf
  • llama
  • text-generation

התאמה ייעודית של מודל הבסיס של מטא לשיחה בסינית ובאנגלית. הוא מיועד למי שצריך תמיכה חזקה בסינית, משחקי תפקידים והפעלת פונקציות על חומרה מקומית נגישה.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 42.5 GBמשקל הקבצים
  • 6,138הורדות בחודש

מה זה

הפיתוח הזה לוקח את מודל ההוראות של מטא ועובר אימון מלא על כל הפרמטרים באמצעות שיטת ORPO, עם מאגר של מעל מאה אלף זוגות העדפות. הדגש כאן הושם על שילוב בין אנגלית לסינית, לצד שיפור ביכולות מתמטיות, משחקי תפקידים וקריאות לפונקציות חיצוניות.

בניגוד למודל המקורי שנוטה להעדיף אנגלית באופן מובהק, כאן נעשה כוונון עמוק עם מסגרת LLaMA Factory כדי שהתשובות בסינית יהיו שוטפות ומדויקות. אין בדף המודל ציוני מבחנים השוואתיים או גרפים, כך שההבטחה לשיפור נשענת על נתוני האימון ולא על תוצאות מבחן סטנדרטיות שפורסמו.

מתאים ל

  • בוט דו לשוני בסינית

    אימון ייעודי על מאה אלף צמדי העדפות הופך אותו לבחירה טבעית לצ'אט שמחייב הבנה עמוקה של סינית ואנגלית.

  • הפעלת פונקציות מקומית

    המודל עבר התאמה מיוחדת לקריאה לכלים ולחישובי מתמטיקה, ומתאים לריצה בתוך רשת סגורה על כרטיס בודד.

  • משחקי תפקידים בסינית

    הכוונון שם דגש מפורש על יכולות שיחה מבוססות דמות, מה שמתאים לפיתוח משחקים או סוכנים וירטואליים.

איפה זה נופל

המגבלה הבולטת ביותר מופיעה ישירות מהמפתחים: הם ויתרו על כוונון הזהות של המודל כדי לשמור על ביצועים, מה שאומר שבשאלות כמו מי יצר אותך תקבלו תשובות אקראיות ולא מדויקות. בנוסף, חלון ההקשר אומן עם חיתוך של 8,192 טוקנים, והמפתחים מציינים במפורש שחלון ה־128K של מודל הבסיס לא נבדק כלל על הגרסה הסינית הזו. עברית אינה מוגדרת כשפה נתמכת, כך שלא כדאי לבנות עליו לפרויקטים מקומיים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לקריאת מסמכים ארוכים של מעל עשרת אלפים טוקנים?

עדיף שלא. אף על פי שמודל הבסיס תומך בעד 128K טוקנים, המפתחים מצהירים שהם אימנו אותו עם חיתוך של 8,192 טוקנים ולא בדקו כלל את ההקשר הארוך. סביר להניח שהביצועים ידרדרו בהקשרים רחבים יותר.

האם המודל מתאים לפיתוח עבור משתמשים בישראל?

רק אם המוצר שלכם פונה לשוק הסיני או דורש עיבוד טקסטים בסינית. המודל הוגדר ואומן עבור אנגלית וסינית בלבד, והוא אינו מותאם לשיחה או הבנה בעברית.

איך מריצים

להרצה מלאה בדיוק המקורי של bfloat16 תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון גרפי, כמו RTX 3090 או כרטיס שרת מקביל, יחד עם התקנה של ספריית transformers בגרסה 4.43.0 ומעלה. הקבצים המלאים שוקלים מעל 40 גיגה בגלל פיצול המשקלים והפורמטים.

למי שאין שרת ייעודי, המפתחים פרסמו גרסאות מכווצות בפורמט GGUF כמו q4_k_m או q8_0. הגרסאות האלה מאפשרות הרצה פשוטה על מחשב אישי רגיל דרך LM Studio או llama.cpp ישירות על המעבד או כרטיס גרפי צנוע בהרבה.

ollama run hf.co/shenzhi-wang/Llama3.1-8B-Chinese-Chat:llama3.1_8b_chinese_chat_q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון Llama 3.1 של מטא. הוא מאפשר שימוש מסחרי חופשי למרבית הפיתוחים, כל עוד המוצר שלכם לא מגיע למאות מיליוני משתמשים פעילים בחודש, ומחייב לשמור על תנאי השימוש המקוריים וייחוס הולם למטא ולמפתחי ההתאמה.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗