GPT
S

Skywork-o1-Open-Llama-3.1-8B

קוד פתוח

Skyworkother2024-11-26

  • safetensors
  • llama
  • text-generation
  • conversational

גרסת צ'אט של לאמה עם שמונה מיליארד פרמטרים שאימנו לחשיבה איטית בסגנון מודלי הסקה. היא מתאימה למי שרוצה יכולות פתרון בעיות מתמטיות ותכנות בחומרה מקומית נגישה.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 122הורדות בחודש

מה זה

הפרויקט הזה לוקח את Llama 3.1 8B ומנסה לחקות את סגנון החשיבה המדורג של מודלים דמויי o1. במקום לפלוט תשובה מיידית, התהליך כולל תכנון מראש, פירוק לשלבי ביניים ובדיקה עצמית בזמן הריצה. לפי המפתחים, מדובר בשילוב של אימון מולטי-סוכן ליצירת דאטה של חשיבה ארוכה, מודל תגמול שלבי ואלגוריתם חיפוש נתיבי הסקה.

במבחני ביצועים של מתמטיקה וכתיבת קוד, המפרסמים טוענים שהגרסה הזו עוקפת את Qwen 2.5 7B Instruct ואת מודל הבסיס המקורי. בפועל זה אומר שהמודל יודע לעצור, לכתוב לעצמו שלבי חישוב, לתקן טעויות תוך כדי תנועה ולהתמודד עם מלכודות לוגיות פשוטות שדגמים בגודל הזה בדרך כלל נופלים בהן.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    הוא מפרק שאלות אלגבריות ומשימות תכנות לשלבים ברורים ובודק את עצמו לפני פליטת התשובה הסופית.

  • התמודדות עם שאלות היגיון

    מנגנון התכנון עוזר לו לעקוף שאלות מכשילות ובעיות לוגיות מילוליות שמבלבלות מודלים קטנים רגילים.

  • מחקר של תהליכי הסקה מקומיים

    המשקל הקל מאפשר לחקור שרשראות חשיבה ואלגוריתמי חיפוש נתיבים על גבי שרת מקומי יחיד.

איפה זה נופל

החשיבה האיטית מייצרת הרבה יותר טוקנים של פלט, מה שמאט משמעותית את זמן המענה ומייקר את הריצה. הכרטיס מציג הצלחות בדוגמאות בסיסיות של ספירת אותיות או בעיות חשבון בסיסיות, אך המפתחים מודים שקיימים סיכונים של הטעיה ושימוש לא מבוקר, ומבקשים לא להעלות אותו לרשת ללא בדיקות אבטחה. מעבר לזה, המודל אומן בעיקר על אנגלית וסינית, כך שאין שום הבטחה או בדיקה לגבי יכולת ההסקה שלו בעברית.

שאלות
נפוצות

האם הוא יעבוד טוב בעברית?

הבסיס הוא לאמה 3.1 שתומך בעברית ברמה מסוימת, אבל הדוגמאות והאימון הנוסף של סקייוורק התמקדו בסינית ובאנגלית. יש לצפות שהסברים מורכבים ותהליכי חשיבה ארוכים ייפגעו או יעברו לאנגלית.

איך המודל מתקן את עצמו תוך כדי כתיבה?

בזמן יצירת הטקסט הוא פולט בדיקות ביניים מילוליות, מחשב מחדש את הנתונים ומוודא שהתוצאה תואמת את השלבים הקודמים לפני שהוא ניגש לפסקה הבאה.

האם כדאי להחליף איתו מודל שיחה רגיל?

לא. בגלל סגנון החשיבה הארוך, הוא מייצר הרבה מלל עד שהוא מגיע לנקודה. למשימות סיכום, תרגום או שיחה פשוטה עדיף להשתמש במודל Instruct סטנדרטי שיענה מהר יותר.

איך מריצים

המשקל הכולל של הקבצים עומד על 15 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך בודד עם 24 גיגה זיכרון כדי להריץ אותו בנוחות ולנצל חלק מחלון ההקשר. אם תרצו לדחוף את כל 131,072 הטוקנים, תצטרכו לחשב היטב את תפיסת הזיכרון של ה־KV cache או להשתמש בכימות.

המפתחים שחררו לצד המודל הזה גם שני מודלי תגמול שלבי בגודל 1.5 ו־7 מיליארד פרמטרים על בסיס קוון. אם אתם בונים שרשרת חשיבה מורכבת שבודקת ומדרגת כל צעד בנפרד, שווה לבדוק את השילוב שלהם. למי שרק צריך תשובה מהירה לשאילתות טקסט רגילות, קריאה ל־API מסחרי תחסוך את עלויות החומרה והתחזוקה.

pip install -U huggingface_hub
hf download Skywork/Skywork-o1-Open-Llama-3.1-8B

הרישיון

הרישיון מוגדר כ־other ומפנה ל־Skywork Community License. המפתחים מציינים שהשימוש המסחרי מותר, אך מחייב עמידה בתנאי הרישיון הקהילתי שלהם. לפני שילוב בקוד מסחרי, מומלץ לאתר ולקרוא את נוסח הרישיון המלא של החברה כדי לוודא שאין בו הגבלות על היקף משתמשים.

הרישיון המלא בעמוד המודל ↗