GPT
H

hacker-news

קוד פתוח

open-indexodc-by2026-03-14

  • hacker-news
  • forum
  • text
  • parquet
  • community

המאגר מרכז עשרות מיליוני רשומות המכילות כל פוסט ותגובה שעלו לקהילת הטכנולוגיה מאז אוקטובר 2006. הוא מתעדכן אוטומטית מדי חמש דקות כדי לשמור על רצף מלא של הדיונים בענף.

  • 28,913הורדות בחודש
  • 342לייקים

מה זה

הנתונים מחולקים לפי חודשים בקובצי Parquet דחוסים, החל משנת 2006 ועד היום. הרשומות כוללות פוסטים רגילים, שרשורי שאלות והשקות, הצעות עבודה, סקרים ובעיקר עשרות מיליוני תגובות של משתמשים. כל רשומה שומרת על המבנה של הממשק הרשמי, עם מזהה מספרי עולה, שיוך לשרשור האב באמצעות מזהה parent, שמות משתמשים, ניקוד, תאריכים ורשימת קישורים לילדים בעץ השיחה.

המקור מגיע משיקוף של הממשק הרשמי דרך ClickHouse יחד עם פנייה ישירה לממשק של פיירבייס לקבלת רשומות חדשות בזמן אמת. הקבצים נשמרים בדחיסת Zstandard ללא סינון תוכן מצד המפרסמים, כך שהם כוללים גם רשומות שנמחקו או סומנו על ידי המנהלים.

מתאים ל

  • אימון מודלי שיחה טכניים

    שימוש בעשרות מיליוני תגובות מקצועיות לאימון מודלים על דיוני קוד ותוכנה.

  • ניתוח מגמות בענף הפיתוח

    מעקב היסטורי אחרי טכנולוגיות, ספריות ונושאים לאורך שני עשורים.

  • בדיקת מערכות אחזור וחיפוש

    בניית מדדי ביצוע למנועי חיפוש על בסיס שאלות טכניות ותשובות הקהילה.

איפה זה נופל

הטקסט בשדה התוכן מגיע כקוד HTML גולמי שמצריך ניקוי ידני של תגיות לפני שמזינים אותו לאימון. התוכן כולו באנגלית ומשקף הטיה מובהקת לעולם הפיתוח, התוכנה ותרבות הסטארטאפים של עמק הסיליקון בארצות הברית, ללא ייצוג מקומי או שפות נוספות.

המאגר כולל פוסטים שסומנו כתוכן פוגעני או כספאם וטקסטים שנמחקו על ידי כותביהם או על ידי מנהלי האתר. אם בונים מודל שמייצר טקסט, חובה לסנן את השדות האלה כדי למנוע כניסת זבל והטיות למשקולות.

שאלות
נפוצות

האם מותר להשתמש במידע הזה למוצר מסחרי?

המאגר מופץ ברישיון מסד נתונים פתוח שאינו מונע שימוש מסחרי ישיר. החובה העיקרית היא מתן קרדיט וייחוס ברור ליוצרי המאגר. אין מניעה חוקית לאמן מודלים על הנתונים לטובת שילובם במוצרים.

האם הדאטהסט כולל טקסט בעברית?

הקהילה מתנהלת כולה באנגלית, ולכן הנתונים מוגדרים תחת שפה זו בלבד. אין במאגר טקסטים בעברית מלבד אזכורים אקראיים ונדירים מאוד של שמות או מושגים בקישורים חיצוניים. לא כדאי לבנות עליו לעיבוד שפה מקומית.

איך המידע נאסף ונשמר במאגר?

הנתונים ההיסטוריים נשלפים ממאגר ציבורי שמתעדכן מהממשק של האתר ונשמרים כקובצי Parquet חודשיים. פוסטים חדשים נאספים מדי חמש דקות ישירות מהממשק הרשמי של האתר. בכל חצות המערכת מרעננת את החודש השוטף כדי להבטיח שלמות ודיוק.

מה היתרון של המאגר הזה מול הורדות רגילות מהרשת?

הוא חוסך גישה איטית לפיירבייס ומציע קבצים דחוסים ומסודרים שמוכנים לשאילתות מהירות בתוך שניות. העדכון הרציף מדי חמש דקות מאפשר להחזיק תמונת מצב עדכנית בלי לתחזק שרת איסוף עצמאי. בנוסף, חלוקת הקבצים לפי חודשים מקלה על הורדת חלקי מידע ספציפיים.

איך טוענים

אין צורך ברישום מיוחד או בקבלת אישור כדי להוריד את הקבצים. אפשר לטעון ישירות דרך ספריית datasets בפייתון במצב הזרמה, להוריד תיקיות לפי שנים באמצעות ממשק הפקודה, או לתשאל מרחוק בעזרת DuckDB ישירות מול המאגר.

בכתיבת שאילתות צריך לשים לב לשם העמודה של שם המשתמש, שמחייב מירכאות כפולות כדי לא להתנגש עם מילת קישור שמורה בשפת SQL. סוג הרשומה נשמר כמספר שלם שנע בין אחת לחמש ולא כמחרוזת טקסט, ושדות המחיקה או החסימה מיוצגים בספרות אפס ואחת.

from datasets import load_dataset

ds = load_dataset("open-index/hacker-news")

הרישיון

המאגר מופץ תחת רישיון ODC-By שמתיר שימוש מחקרי ומסחרי. הרישיון דורש מתן קרדיט וייחוס ברור למאגר המקורי בעת הפצתו, אך אינו כופה רישוי זהה על תוצרים נגזרים ומודלים שאומנו על בסיסו.

הרישיון המלא ב־Hugging Face ↗