GPT

מודלים ותשתית · לא צוין

הלוגו של OpenAssistant Conversations - Democratizing Large Language Model Alignment

OpenAssistant Conversations - Democratizing Large Language Model Alignment

הפרויקט מציע מאגר שיחות מתויג שנאסף באמצעות מיקור המונים, לצד מודל שפה פתוח שאומן על גבי המידע הזה. המטרה היא להביא מודלים פתוחים להתנהגות שמזכירה עוזר אישי, באופן שמתאים להעדפות אנושיות.

בניגוד לרוב המאגרים הפתוחים שמסתמכים על מידע מלאכותי וממוחזר ממודלים קיימים, כאן כל השיחות והדירוגים נכתבו ונבדקו על ידי בני אדם. זה מספק לחוקרים ולמפתחים גישה חופשית לנתוני התאמה וכיול בלי להיות תלויים במערכות הסגורות של החברות הגדולות.

  • מודלים ותשתית
  • לא צוין
  • ממשק באנגלית

דירוג הקהילה

עוד לא דורג

תהיו הראשונים לדרג.

התחברות עם גוגל

דירוג אחד לכל אדם לכל כלי, ולכן צריך חשבון. אנחנו שומרים גיבוב של מזהה החשבון ואת השם הפרטי, ולא את הדוא״ל, לא את שם המשפחה ולא את התמונה.

לא נשלח אליכם דבר ולא נפרסם דבר בשמכם.

איך הדירוג עובד+

הדירוג פתוח רק למי שמחובר עם חשבון גוגל, דירוג אחד לכל אדם לכל כלי. זו הדרך שלנו לוודא שמדובר באדם אמיתי: היא אינה מוכיחה שהמדרג השתמש בכלי, וזה הבדל שכדאי לזכור כשקוראים ממוצע.

מי שכותב ביקורת מוצג בשמו הפרטי בלבד, כפי שהוא מופיע בחשבון גוגל. מעבר לזה לא נשמר דבר: לא שם משפחה, לא כתובת דוא״ל ולא תמונה: רק גיבוב חד־כיווני של מזהה החשבון, שמאפשר לכם לשנות את הדירוג שלכם ולא מאפשר לנו לדעת מי אתם.

ביקורת אינה יכולה להכיל קישורים, כתובות דוא״ל, מספרי טלפון או שמות משתמש. זה לא סינון תוכן, זה מה שמונע ממקום כזה להפוך ללוח מודעות.

תמחור
לא צוין
קטגוריה
מודלים ותשתית
שפת האתר
אנגלית
כתובת
drive.google.com
נבדק
2026-09-09

הסקירה

הפרויקט הזה מפרסם מאגר נתונים וקוד פתוח לאימון עוזרי שיחה, במקום לשמור אותם מאחורי חומות מסחריות. הוא מבוסס על עבודת התנדבות המונית שנועדה להתחרות במודלים סגורים כמו ChatGPT בלי להסתמך על מידע מלאכותי שנוצר על ידי מכונות אחרות. הצוות אסף 161,443 הודעות שנפרסו על פני 66,497 עצי שיחה בתוך 35 שפות שונות. כל עץ כזה מייצג מסלולים אפשריים בין שואל לעוזר, כולל 461,292 דירוגי איכות שנוצרו בידי בני אדם. התוצאה היא משאב חופשי שמיועד לאימון supervised fine-tuning ומודלי תגמול עבור RLHF. זה פרויקט מחקרי טהור.

מי שמחפש פה תחליף זריז למערכת צ'אט משרדית יתאכזב מיד. זהו מאגר נתונים פתוח למפתחים ולחוקרים, לא יישום מוגמר שמתקינים בלחיצה כדי לסגור משימות יומיות. מעל 13,500 מתנדבים השתתפו באיסוף דרך פלטפורמת אינטרנט ייעודית, כשהם מבצעים יותר מ־625,000 משימות שונות של כתיבה, תיוג ודירוג תשובות לפי העדפות אישיות. הגישה לקוד נמצאת ב־GitHub והמידע עצמו יושב ב־HuggingFace תחת רישיונות מתירניים לחלוטין. אם אתם בונים מודל עצמאי ורוצים נתוני התאמה אנושיים, זה בדיוק המקום שמספק את חומרי הגלם הדרושים לעבודה שלכם.

מבנה הנתונים ואיסוף התוכן

בסיס הנתונים בנוי במבנה היררכי שנקרא עץ שיחה, שבו כל צומת הוא הודעה שנכתבה על ידי אדם או מכונה בתפקיד שואל או עוזר. השורש של כל עץ מתחיל בהנחיה ראשונית, וממנה מתפצלים ענפים המייצגים תגובות שונות של העוזר, המשכי שיחה ותיוגי איכות. המערכת חילקה את תהליך העבודה לחמש משימות בודדות כדי למנוע אובדן מידע כשאנשים נוטשים באמצע. המתנדבים כתבו הנחיות, הוסיפו תגובות, הדביקו תוויות בטיחות ודירגו תשובות מקבילות זו מול זו. המבנה הזה מאפשר לחלץ רצפי שיחה שלמים לצד צמדי השוואה מדויקים שנחוצים עבור מודלי תגמול.

זה עובד אחרת לגמרי ממאגרים סינתטיים.

ההבדל המרכזי מול מאגרים חופשיים אחרים הוא ההסתמכות המלאה על בני אדם במקום על שאילתות אוטומטיות למודלים קיימים. מערכות רבות מסתמכות על טקסטים שמיוצרים על ידי מודלים מסחריים, מה שיוצר לעיתים קרובות תוכן מוגבל ברמת היצירתיות שלו ומבוסס על רשימת הוראות קבועה מראש. כאן איסוף התוכן נעשה בפיקוח שכלל סינון דואר זבל ובקרת איכות על גבי יותר מ־10,000 עצים מסוננים ומתוייגים במלואם. מחקר העדפות שמובא במסמך מציג שיעור העדפה של 48.3% לתשובות של OpenAssistant מול 51.7% לטובת מודל GPT-3.5-turbo של חברת OpenAI. הפער מפתיע לטובה.

שלבי איסוף הנתונים בפלטפורמה

  1. 01כתיבת הנחיה ראשונית
  2. 02תיוג הנחיות ובדיקת בטיחות
  3. 03הוספת תגובות שיחה
  4. 04תיוג איכות של תשובות
  5. 05דירוג תגובות העוזר

למי זה שווה את המאמץ

לא הייתי משתמש בזה למי שמחפש פתרון ארגוני מהיר לניהול לקוחות או כתיבת מסמכים שוטפת, כי אין פה שירות ענן מוכן לשימוש עסקי יומיומי. הכלי מתאים לחוקרים, מדעני נתונים ומפתחי למידת מכונה שרוצים לאמן מודלים על תשתית עצמאית בלי תלות במדיניות חברות מסחריות. האתר מציין שהמאגר כולל 35 שפות שונות, אך הוא אינו מפרט את רשימת השפות המלאה ולכן לא ידוע מה היקף העברית שם, אם היא קיימת בכלל. אם אתם זקוקים להתאמה מדויקת בעברית, שווה לבדוק את הרכב השפות בקבצים לפני שמתחילים אימון.

אין פה עלויות נסתרות.

מבחינת כסף, אין באתר מחירון משום שהקוד והנתונים משוחררים בחינם תחת רישיונות שימוש פתוחים לחלוטין. הגישה למאגר עצמו אינה עולה דבר, אך החזקת התשתית לאימון מודלים כאלה דורשת מעבדים גרפיים יקרים משלכם או שכירת שרתים בענן. אין כאן מדרגות מנוי, תוכניות חודשיות או מסלולים בתשלום, והכול זמין להורדה ישירה דרך המאגרים הציבוריים של הפרויקט. מה שבאמת מפריע כאן הוא חוסר הפירוט על חלוקת השפות, שמחייב אתכם להוריד את הקבצים ולסנן אותם לבד כדי לוודא התאמה לפרויקט מקומי.

תצטרכו לבדוק את הקבצים בעצמכם.

  • מחיר שימושחינם בקוד פתוח
  • תמיכה בעבריתלא צוינה בפירוט
  • מספר שפות35 שפות שונות

מה OpenAssistant Conversations - Democratizing Large Language Model Alignment
עושה

הנתונים נאספים דרך ממשק ווב שמחלק את העבודה למשימות קטנות, כמו כתיבת הנחיות ראשוניות, מתן מענה בתור עוזר, תיוג וסינון ספאם. כל שיחה בנויה כמבנה עץ, שבו לכל שאלה יכולות להיות כמה תגובות שונות שמתפתחות לכיוונים נפרדים.

המתנדבים מדרגים את התגובות השונות של העוזר לפי איכותן, מה שיוצר סדר עדיפויות מוגדר לכל פיצול בשיחה. המאגר כולל 161,443 הודעות בתוך 66,497 עצי שיחה ב־35 שפות שונות, ומכיל 461,292 דירוגי איכות שנוצרו על ידי יותר מ־13,500 משתמשים.

כמה זה
עולה

הקוד והנתונים משוחררים תחת רישיונות מתירניים ללא תשלום, אך המסמך לא מציין עלויות שימוש נוספות באתר או במודל.

למי זה
מתאים

המאגר מתאים לחוקרי בינה מלאכותית, למהנדסי למידת מכונה ולצוותי פיתוח שרוצים לאמן, לכוונן או לחקור מודלי שיחה ומודלי דירוג באופן עצמאי בקוד פתוח.

הוא לא מתאים למי שמחפש כלי מדף מוכן לניהול משימות יומיות או לעסקים שצריכים עוזר אישי שעובד מיידית בלי התעסקות עם קוד, נתונים או אימון מודלים.

מה לבדוק
לפני שמתחייבים

לפני שמתחילים להסתמך על המאגר בעברית, צריך לבדוק את שיעור ההודעות בעברית מתוך 35 השפות שנאספו. החומר אינו מפרט את החלוקה המדויקת לפי שפה, ולכן ייתכן שרוב הנתונים הם באנגלית ומיעוטם בלבד רלוונטי לשימוש מקומי.

בנוסף, מאחר שהנתונים נאספו ממתנדבים ברשת, יש לבחון את אופי הסינון ובקרת האיכות על התכנים לפני שמזינים אותם למערכות רגישות.

מה אומרים
המשתמשים

עוד אף אחד לא כתב על OpenAssistant Conversations - Democratizing Large Language Model Alignment כאן. אם השתמשתם בOpenAssistant Conversations - Democratizing Large Language Model Alignment, השורה הראשונה היא שלכם.

להשאיר חוות דעת אנחנו לא מוחקים ביקורת שלילית, ולא מסמנים אף כלי כמומלץ בתשלום.

מה OpenAssistant Conversations - Democratizing Large Language Model Alignment
אומר על עצמו

OA_Paper_2023_04_15.pdf

מהאתר של OpenAssistant Conversations - Democratizing Large Language Model Alignment, נקרא ב־2026-09-09. הטקסט הוא שלהם.

אנחנו לא מתרגמים תיאורי שיווק ומגישים אותם ככתיבה שלנו. שיטת העבודה.

שאלות
נפוצות

איך המודל שפותח בפרויקט מתמודד מול מודלים מסחריים?

במבחן העדפות מול GPT-3.5-turbo של OpenAI, המודל OpenAssistant השיג שיעור העדפה יחסי של 48.3% לעומת 51.7% למודל המסחרי.

האם אפשר להשתמש במידע ובקוד לפיתוח מסחרי?

היוצרים שחררו את הקוד ואת מאגר הנתונים תחת רישיונות מתירניים לחלוטין, מה שמאפשר גישה פתוחה ושימוש נרחב לצורכי מחקר ופיתוח.

מה OpenAssistant Conversations - Democratizing Large Language Model Alignment עושה?

הפרויקט מציע מאגר שיחות מתויג שנאסף באמצעות מיקור המונים, לצד מודל שפה פתוח שאומן על גבי המידע הזה. המטרה היא להביא מודלים פתוחים להתנהגות שמזכירה עוזר אישי, באופן שמתאים להעדפות אנושיות. בניגוד לרוב המאגרים הפתוחים שמסתמכים על מידע מלאכותי וממוחזר ממודלים קיימים, כאן כל השיחות והדירוגים נכתבו ונבדקו על ידי בני אדם. זה מספק לחוקרים ולמפתחים גישה חופשית לנתוני התאמה וכיול בלי להיות תלויים במערכות הסגורות של החברות הגדולות.

האם OpenAssistant Conversations - Democratizing Large Language Model Alignment חינמי?

באתר של OpenAssistant Conversations - Democratizing Large Language Model Alignment לא נמצא מידע ברור על תמחור בזמן הבדיקה (2026-09-09).

האם OpenAssistant Conversations - Democratizing Large Language Model Alignment תומך בעברית?

האתר של OpenAssistant Conversations - Democratizing Large Language Model Alignment מוגש באנגלית. זה לא אומר שהכלי לא יעבוד עם טקסט בעברית, אבל זה כן אומר שהוא לא נבנה סביבה.

יש חלופות ל־OpenAssistant Conversations - Democratizing Large Language Model Alignment?

כן. באתר יש 101 כלים בקטגוריית מודלים ותשתית, וחלקם מוצגים בתחתית העמוד הזה. ההשוואה שכדאי לעשות היא בין תמחור, שפת הממשק והתאמה למה שאתם צריכים לעשות, לא בין רשימות תכונות.

כלים דומיםבמודלים ותשתית

כל 101 הכלים
  • הלוגו של OpenRAIL-M v1 קוד פתוח

    OpenRAIL-M v1

    הסכם רישוי למודלי שפת קוד המאפשר שימוש חופשי לצד הגבלות שימוש מחייבות.

    מודלים ותשתית bigcode-project.org
  • הלוגו של Pentaho Business Analytics בתשלום

    Pentaho Business Analytics

    ניהול אחסון נתונים ושליטה מאוחדת בסביבות היברידיות באמצעות בינה מלאכותית.

    מודלים ותשתית hitachivantara.com
  • הלוגו של Pinecone בתשלום

    Pinecone

    בסיס נתונים וקטורי מנוהל לחיפוש סמנטי ושליפת מידע עבור סוכני בינה מלאכותית.

    מודלים ותשתית pinecone.io
  • הלוגו של Prodia לא צוין

    Prodia

    הופך תשתית AI מורכבת לתהליכי עבודה מוכנים לייצור, למפתחים.

    מודלים ותשתית app.prodia.com
  • הלוגו של Qdrant קוד פתוח

    Qdrant

    חיפוש וקטורי מהיר ומסד נתונים ייעודי לשליפת מידע עבור יישומי בינה מלאכותית

    מודלים ותשתית qdrant.tech
  • הלוגו של RedPajama קוד פתוח

    RedPajama

    מאגר נתונים פתוח של מעל 1.2 טריליון טוקנים לאימון מודלי שפה מסחריים.

    מודלים ותשתית together.xyz