GPT
D

deepseek-math-7b-instruct

קוד פתוח

deepseek-aiother2024-02-05

  • transformers
  • pytorch
  • llama
  • text-generation
  • conversational

מודל שפה קומפקטי שמכוון ספציפית לפתרון בעיות מתמטיקה והסקה שלב אחר שלב. אם אתם צריכים חישובים מדויקים בגודל שרץ על חומרה מקומית, הוא מועמד מתאים.

  • 4,096טוקנים בהקשר
  • 12.9 GBמשקל הקבצים
  • 4,295הורדות בחודש
  • 155לייקים

מה זה

מדובר במודל של שבעה מיליארד פרמטרים ממשפחת DeepSeek, שמבוסס על ארכיטקטורת Llama ועבר התאמה ממוקדת למתמטיקה בעזרת הנחיות מפורטות. במקום לנסות לכתוב שירים או לסכם מאמרים כלליים, המטרה כאן היא התמודדות עם תרגילים, משוואות והוכחות פורמליות.

הוא מגיע בדיוק של bfloat16 עם חלון הקשר של 4,096 טוקנים, שזה די והותר לשרשראות חשיבה ארוכות של פתרון תרגיל, אבל לא מתאים להזנה של ספרי לימוד שלמים. היכולת המרכזית שלו נשענת על הנחיה לפתרון צעד אחר צעד, תוך סימון התוצאה הסופית בפורמט מוגדר.

מתאים ל

  • פתרון תרגילים שלב אחר שלב

    מתאים למערכות שבודקות או מציגות הסברים לבעיות מתמטיות באנגלית, בזכות תבנית הפירוק המובנית.

  • חילוץ תשובות מספריות

    מייצר תוצאה סופית בפורמט קבוע שמקל על פרסור אוטומטי של התשובה מתוך ההסבר.

  • עוזר למידה למדעים מדויקים

    מאפשר הרצה מקומית ללא עלויות ענן לסטודנטים או לחוקרים שצריכים פירוק מתמטי של משוואות.

איפה זה נופל

המודל רגיש מאוד לאופן שבו פונים אליו. יוצרי המודל מזהירים במפורש לא להשתמש ב system prompt כי הגרסה הזו פשוט לא תומכת בו וזה עלול לשבש את התשובות. בנוסף, אם לא תדרשו ממנו מפורשות לפתור צעד אחר צעד ולהחזיר את התוצאה בתוך תיבה מוגדרת, הביצועים שלו יורדים. הוא גם מותאם כרגע רק לאנגלית ולסינית, כך שאין מה לבנות עליו לפתרון בעיות מילוליות בעברית.

אותה משפחה

deepseek-math יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בעברית?

לא מומלץ בכלל. ההנחיות והאימונים של גרסת ההוראות נבנו ספציפית לאנגלית ולסינית. ניסוח שאלות בעברית יוביל לפגיעה ביכולת החישוב ולהזיות.

איך צריך לנסח לו את השאלה כדי לקבל תוצאה טובה?

חייבים להוסיף לפרומפט הוראה לפתור צעד אחר צעד ולשים את התוצאה הסופית בתוך תבנית boxed, בהתאם לדוגמה שהיוצרים פרסמו. בלי זה הוא מתקשה להגיע לתשובה הנכונה.

איך מריצים

המשקל עומד על כמעט 13 גיגה בייט, כך שצריך כרטיס מסך עם לפחות 16 גיגה זיכרון כדי להריץ אותו בנוחות בדיוק המקורי, או לחלופין לבצע קוונטיזציה לחומרה צנועה יותר. הוא נתמך ישירות בספריית transformers הרגילה של פייתון.

בפועל, אם אתם צריכים רק שאילתות בודדות ולא רוצים להחזיק שרת ייעודי, עדיף להשתמש בנקודת קצה מנוהלת או בממשק רשת. הרצה עצמית שווה את המאמץ בעיקר אם יש לכם דרישות פרטיות או נפח בדיקות קבוע של תרגילים.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-math-7b-instruct")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת תנאי שימוש ייעודיים של דיפסיק ולא כרישיון קוד פתוח סטנדרטי, אך החברה מציינת במפורש שהוא מאפשר שימוש מסחרי. עם זאת, הקוד עצמו בגיטהאב תחת MIT והמודל כפוף להסכם נפרד, ולכן חובה לקרוא את קובץ הרישיון המלא לפני הטמעה במוצר כדי לוודא שאין מגבלות ספציפיות על תחום הפעילות שלכם.

הרישיון המלא בעמוד המודל ↗