GPT
T

Truthful_DPO_TomGrc_FusionNet_7Bx2_MoE_13B

קוד פתוח

yunconglongmit2024-01-21

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • moe

שילוב של שני מודלי 7B במבנה מומחים שעבר כיוונון להפחתת הזיות בעזרת DPO. מתאים למי שמחפש מודל מקומי קומפקטי שמנסה להיצמד יותר לעובדות.

  • 13Bפרמטרים
  • 32,768טוקנים בהקשר
  • 24.0 GBמשקל הקבצים
  • 8,414הורדות בחודש

מה זה

מדובר במיזוג של שני מודלים בגודל 7B בארכיטקטורת תערובת מומחים, שיחד מגיעים לכמעט 13 מיליארד פרמטרים. הבסיס המקורי נלקח מפרויקט FusionNet, ועליו הריצו אימון DPO בעזרת הדאטה-סט truthy-dpo במטרה ישירה לצמצם תשובות מומצאות ושגויות.

במקום לקבל מודל 13B צפוף ורגיל, הארכיטקטורה הזו מפעילה רק חלק מהמשקולות בכל טוקן, בדומה למבנה של מיקסטרל. זה נותן פוטנציאל לתגובה מהירה יחסית, תוך שמירה על עומק הידע של שני מודלים שאוחדו יחד. כרטיס המודל לא מציג ציוני מבחנים רשמיים, כך שחובת ההוכחה לגבי רמת הדיוק מול מודלים מסחריים נשארת אצלכם בבדיקות בפועל.

מתאים ל

  • הפקת תוכן עובדתי באנגלית

    הוא עבר כיוונון ייעודי לצמצום שגיאות, מה שעוזר במשימות של תמצות והסבר נתונים.

  • עבודה מקומית ללא רשת

    מבנה המומחים בגודל 13B מאפשר הרצה פרטית על תחנת עבודה סבירה בלי לשלוח מידע החוצה.

  • ניתוח מסמכים ארוכים

    תמיכה בחלון של 32,768 טוקנים מתאימה לקריאה של טקסטים ארוכים יחסית בפעימה אחת.

איפה זה נופל

כרטיס המודל דל מאוד ולא מציג שום מדידות, הערכות או מבחני ביצועים שיעידו האם הכיוונון אכן הפחית הזיות בפועל. מעבר לזה, המודל אומן על נתונים כלליים באנגלית, כך שאין שום הבטחה או תיעוד לתמיכה סבירה בעברית. לפני שמשלבים אותו במוצר אמיתי, חובה לבדוק ידנית איך הוא מתמודד עם שאלות עובדתיות מורכבות והאם הוא לא פולט שטויות בביטחון מלא.

שאלות
נפוצות

האם הוא יעבוד טוב בעברית?

האימון והכיוונון נעשו סביב דאטה-סטים באנגלית, ואין אזכור לעברית בתיעוד. סביר להניח שהוא יקרטע, יפיק משפטים שבורים או יתרגם באופן עילג, ולכן למשימות בעברית כדאי לבחון אותו בזהירות רבה.

האם הוא באמת מדויק יותר ולא ממציא עובדות?

הכיוונון בשיטת DPO נועד בדיוק למטרה זו, אך היוצר לא פרסם תוצאות בנצ'מרק שמוכיחות שיפור. תצטרכו להריץ עליו סט שאלות בדיקה משלכם כדי לראות אם ההבטחה מחזיקה מים.

איך מריצים

כדי להריץ אותו בפורמט bfloat16 המקורי תצטרכו כרטיס מסך עם לפחות 32 גיגה-בייט זיכרון, שכן המשקולות עצמן תופסות 24 גיגה-בייט וצריך מקום לחלון הקשר סביר. אם אין לכם חומרה כזו מקומית, עדיף לכמת אותו ל־4 ביט ולהריץ על כרטיס צרכני עם 16 או 24 גיגה-בייט זיכרון.

אם אתם צריכים רק מענה מזדמן ולא מחויבים להרצה עצמאית בגלל פרטיות המידע, שירותי ענן או ממשקי API חיצוניים יחסכו לכם התעסקות עם שרתים יקרים, במיוחד לאור העובדה שניהול מודל כזה בזיכרון דורש משאבים לא מבוטלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="yunconglong/Truthful_DPO_TomGrc_FusionNet_7Bx2_MoE_13B")
print(pipe("שלום"))

הרישיון

רישיון MIT מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה מחדש. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של היוצר המקורי. אפשר לשלב אותו במוצר מסחרי סגור בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗