בירור בירור מספר דברים בשיטת zstd
-
@pcinfogmach לא צריך לקבל פיק ברכיים מה-3 ימים של אימון כי זה אתם יכולים לעשות בסוף התהליך. וזה המחשב עושה עבורך, אתה לא מעורב כלל... זה פשוט תהליך שמוצא את המילון הכי כדאי לקורפוס הטקסט שלך (אין לי מושג אם זה באמת יארוך 3 ימים...)
ומי שלמד תכנות גם לא למד את זה. זה משהו יותר נישתי שלומדים מתי שצריכים את זה@yossiz כתב בבירור בירור מספר דברים בשיטת zstd:
אין לי מושג אם זה באמת יארוך 3 ימים...
זה היה מליצה, או מחשב פצצה וזה לוקח שניה, או 286 IBM ושלוש ימים (כנראה פחות)...
אני לא מבין איך אתה מסכים שהם יעשו חיפוש על שורות דחוסות!
@pcinfogmach היום החיפוש עובד עם LIKE של SQLLITE??בקשר לאימון כפי שאמרתי זה היה בדיחה, זה תהליך חד פעמי של דקות בודדות, בזמן פיתוח.
בקשר לעלות הפרישה (פתיחה מדחיסה) כפי שאומר @yossiz זה כלום כלום, כל עוד אנחנו לא מדברים על חיפוש. -
@yossiz כתב בבירור בירור מספר דברים בשיטת zstd:
אין לי מושג אם זה באמת יארוך 3 ימים...
זה היה מליצה, או מחשב פצצה וזה לוקח שניה, או 286 IBM ושלוש ימים (כנראה פחות)...
אני לא מבין איך אתה מסכים שהם יעשו חיפוש על שורות דחוסות!
@pcinfogmach היום החיפוש עובד עם LIKE של SQLLITE??בקשר לאימון כפי שאמרתי זה היה בדיחה, זה תהליך חד פעמי של דקות בודדות, בזמן פיתוח.
בקשר לעלות הפרישה (פתיחה מדחיסה) כפי שאומר @yossiz זה כלום כלום, כל עוד אנחנו לא מדברים על חיפוש. -
@yossiz כתב בבירור בירור מספר דברים בשיטת zstd:
אין לי מושג אם זה באמת יארוך 3 ימים...
זה היה מליצה, או מחשב פצצה וזה לוקח שניה, או 286 IBM ושלוש ימים (כנראה פחות)...
אני לא מבין איך אתה מסכים שהם יעשו חיפוש על שורות דחוסות!
@pcinfogmach היום החיפוש עובד עם LIKE של SQLLITE??בקשר לאימון כפי שאמרתי זה היה בדיחה, זה תהליך חד פעמי של דקות בודדות, בזמן פיתוח.
בקשר לעלות הפרישה (פתיחה מדחיסה) כפי שאומר @yossiz זה כלום כלום, כל עוד אנחנו לא מדברים על חיפוש.@dovid כתב בבירור בירור מספר דברים בשיטת zstd:
@pcinfogmach היום החיפוש עובד עם LIKE של SQLLITE??
כמו ש @yossiz ציין החיפוש נעשה על ידי מנוע חיפוש tantivy.
השימוש בDB בעת החיפוש נעשה לאחר שמנוע החיפוש החזיר את התוצאות וכדי להציג גזירים עבור תוצאות החיפוש. -
מעולה, אז כל ההתייעצות היא מפחד שגוי.
פתיחה של טקסטים באורך כזה, זה לחם חוקו של המחשב.
בכל דפדוף באינטרנט יש מאות פעולות יקרות בהרבה.
לא צריך מקביליות ולא צריך שום טריק להרוויח ביצועים.@dovid כתב בבירור בירור מספר דברים בשיטת zstd:
פתיחה של טקסטים באורך כזה, זה לחם חוקו של המחשב.
והשליחה לאינדקס עצמו?
כרגע אינדוקס לוקח דקות בודדות.
לקורא ולפענח כמות כזו של חומר - זה גם נכלל ב"לחם חוקו"? כלומר - האם זה לא יאט את האינדוקס במידה ניכרת?
תודה על המענה המפורט! -
יש פה בעיית תקשורת, אני כל הזמן בהבנה שמה שדחוס זה סטטי ולא משתנה,
והאינדקס נוצר בכלל אצל המפיץ או הכי גרוע אצל המשתמש לפני בכלל שהחומר מוכנס לדחיסה.
אולי תרחיבו לי מה המידע הרבה שדחוס ומאונדקס?
לא מדובר בספרי קודש של הבית היהודי?
אם ככה אז האינדקוס יכול בכלל להתבצע בבית המפיץ פעם אחת ולתמיד.
גם אם המשתמש מוסיף אי אלו טקסטים משלו, אז: יוצרים שורות בלתי דחוסות, מאנדקסים, דוחסים, שלום על ישראל.
אני מפספס משהו? -
יש פה בעיית תקשורת, אני כל הזמן בהבנה שמה שדחוס זה סטטי ולא משתנה,
והאינדקס נוצר בכלל אצל המפיץ או הכי גרוע אצל המשתמש לפני בכלל שהחומר מוכנס לדחיסה.
אולי תרחיבו לי מה המידע הרבה שדחוס ומאונדקס?
לא מדובר בספרי קודש של הבית היהודי?
אם ככה אז האינדקוס יכול בכלל להתבצע בבית המפיץ פעם אחת ולתמיד.
גם אם המשתמש מוסיף אי אלו טקסטים משלו, אז: יוצרים שורות בלתי דחוסות, מאנדקסים, דוחסים, שלום על ישראל.
אני מפספס משהו?@dovid כתב בבירור בירור מספר דברים בשיטת zstd:
אם ככה אז האינדקוס יכול בכלל להתבצע בבית המפיץ פעם אחת ולתמיד.
נכון - כך באמת יהיה בעז"ה מהגרסה הבאה.
ועדיין, אני מכיר את המשתמשים
המון ימשיכו את האינדקס כפי שהיה עד היום.
אל תשאל למה: גם אני לא יודע... (בשעתו הייתה אפשרות לחיפוש ללא אינדקס, ועד שהסרנו אותה עוד היו שהשתמשו בה, ושאלו למה אין שם עוד אופציות, כפי שהוספנו בחיפוש עם האינדקס).
עריכה: מצד שני, כפי שכתב לי אחד התורמים, שליפת הטקסט עצמו מהדיסק קטנה וזולה יותר - אולי זה מאפס את הפיענוח. -
הפיענוח לא לוקח כמעט כלום בלי קשר לחיסכון שיש או אין בקריאה... לא צריך לקזז את ההקטנה של הקלט.
תבקש מהAI לכתוב לך טסט קטן, לבדוק כמה זמן מדובר. -
@pcinfogmach
א. זה לא חינמי, זה עולה $4,000 אם הבנתי נכון
ב. אין לזה יתרון עבורך, הדחיסה תהיה פחות טובה -
@pcinfogmach אם אתם רוצים דחיסה יותר טובה, כדאי לבדוק אפשרות לשמור בלוקים של כמה שורות טקסט, (מאתיים שורות לבלוק למשל) פר שורה ב-DB, ובנוסף אינדקס שמצביע על ה-offset של כל שורה, כדי שתוכלו עדיין לגשת לטקסט ברמת שורה, זה ישפר את רמת הדחיסה. אני לא יודע בכמה. בלי מילון מותאם אישית זה יהיה הבדל משמעותי, עם מילון זה פחות חשוב אבל עדיין יעזור.
המחיר של פיענוח 200 שורות פר שליפה לעומת שורה אחת אמור להיות זניח