GPT
L

Liberated-Qwen1.5-72B

קוד פתוח

abacusaiother2024-02-29

  • transformers
  • pytorch
  • qwen2
  • text-generation
  • conversational

גרסה לא מצונזרת של מודל הדגל מבית עליבאבא, שנועדה לציית להנחיות מערכת נוקשות בשיחות ארוכות. היא מתאימה למי שחייב שליטה מלאה בפלט בלי סירובים מובנים.

  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 79הורדות בחודש
  • 104לייקים

מה זה

מדובר בכיוונון עדין על גבי Qwen1.5-72B שנעשה על ידי אריק הרטפורד וצוות AbacusAI. המטרה המרכזית כאן היא היצמדות מדויקת לפרומפט המערכת לאורך שיחות מרובות שלבים, גם כשההוראות מוזרות או טכניות מאוד. כדי להשיג את זה, הם אימנו אותו על דאטה סט סינתטי של ששת אלפים שיחות שיוצרו באמצעות Mistral-Medium ודגם דולפין, תוך הסרה מלאה של מנגנוני סינון ובלימת תכנים.

במבחני MT Bench צ'קפוינט מוקדם של האימון השיג ציון של 8.45 בסיבוב הראשון, מעט מעל מודל הצ'אט המקורי. מצד שני, בסיבוב השני הציון יורד ל־7.65 לעומת 8.23 במקור, מה שמראה שאיכות השיחה נשחקת ככל שהיא מתארכת. במבחן MMLU הוא מחזיק ציון של 77.13, כך שיכולות ההבנה הכלליות שלו עדיין חזקות וקרובות למקור.

מתאים ל

  • סוכנים עם הנחיות קשיחות

    הוא אומן במיוחד לבצע הוראות מערכת מכניות או מוזרות בלי לסטות מהן במהלך הדיאלוג.

  • פלט מובנה ונטול סירובים

    מתאים להפקת נתונים בפורמטים כמו JSON למשימות שבהן מודלים מסחריים נוטים לסרב בטעות.

  • יצירת תוכן חופשי

    מייצר טקסטים יצירתיים ומשחקי תפקידים בלי חסימות תוכן של מנגנוני התאמה רגילים.

איפה זה נופל

המודל מגיע בלי שום מנגנון בטיחות או צנזורה. אם אתם חושפים אותו למשתמשי קצה בלי שכבת הגנה משלכם, הוא יענה על כל דבר בלי לחסום תוכן פוגעני או רגיש. בנוסף, למרות שלבסיס יש הקשר של 32 אלף טוקנים, האימון בפועל נעשה על קלטים של עד 8,000 טוקנים בלבד, כך שהביצועים בקצוות הטווח לא מובטחים. נפילת הביצועים בסיבוב השיחה השני בבנצ'מרק דורשת בדיקה יסודית אם אתם בונים עליו לסוכנים מורכבים.

שאלות
נפוצות

האם המודל תומך בחלון הקשר של 32k מלא?

הארכיטקטורה הבסיסית תומכת בכך, אבל כוונון ה־LoRA בוצע על רצפים באורך של עד 8,000 טוקנים בלבד. היוצר מציין במפורש שהתוצאות בטקסטים ארוכים מזה עשויות להשתנות, ולכן צריך לבדוק אותו מקומית לפני שמסתמכים על ההקשר המלא.

האם אפשר להשתמש בו במוצר בלי פילטרים נוספים?

לא מומלץ בכלל. הדאטה סט נוקה מכל מנגנון סינון, והיוצר מבהיר שהאחריות על התוכן היא שלכם בלבד. אם המערכת שלכם משרתת לקוחות, אתם חייבים להוסיף שכבת בדיקה חיצונית לפני שהפלט חוזר למשתמש.

איך מריצים

כדי להעלות קבצים במשקל 135 ג'יגה בייט בדיוק float16, תצטרכו שרת עם לפחות שני כרטיסי A100 או H100 של 80GB, רק כדי לטעון את המשקלים לזיכרון לפני שמחשבים טוקן אחד. האימון המקורי דרש שמונה כרטיסי H100 במשך שלושה ימים עם Axolotl ו־qLoRA.

אם אין לכם קלאסטר כזה בחצר או בענן, הרצה עצמאית תעלה לכם אלפי דולרים בחודש. במקרה כזה עדיף לחפש ספק שמחזיק את המודל מאחורי API, או לכווץ אותו לקוונטיזציה של 4 ביט כדי לדחוס אותו למכונה זולה יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="abacusai/Liberated-Qwen1.5-72B")
print(pipe("שלום"))

הקבצים

42 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר תחת תנאי tongyi-qianwen של עליבאבא ולא תחת רישיון קוד פתוח סטנדרטי. הוא דורש בדיקה של תנאי השימוש המקוריים לגבי מסחור, מגבלות משתמשים חודשיות וציות לחוק, במיוחד אם אתם משלבים אותו במוצר מסחרי מול לקוחות.

הרישיון המלא בעמוד המודל ↗