התייעצות האם הAI הסיני יגרום לשינויים משמעותיים בשוק ההון?

  • הוסף לסימניות
  • #21
אני מנחש שסינים משקרים.
מישהו בדק אותם שבאמת אלה היו העליות שלהם?
מה נראה לך השקר כאן?
הם השיגו כמויות GPU בדרך סודית?
את הביצועים של המודל אפשר לבדוק לבד כי הוא בקוד פתוח
 
  • הוסף לסימניות
  • #22
צריך להבין שמניה יורדת כי נראה שלכאורה לא צריך מעבדים כה גדולים כדי להפעיל את המודולים האלו (שזו ההתמחות של אינבידה)
אבל זה רק בטווח הקרוה כמו שתמיד הבורסה מגיבה לבשורות
לדעתי העניה בלבד
זה רק מוכיח עד כמה עולם הAI גדל במהירות -מה שמכריח שימוש במעבדים
כך או כך אנבידה תצטרך לעלות בסוף-כי שם העתיד

רק שיתפתי את מחשבתי-אשמח לשמוע תגובות
הנה פוסט לדוגמה מX

@Assaf_Nathan


לקח לי חצי שנה - אבל עכשיו אני יכול לומר שאני בשורט $NVDA מהבוקר (בוצע ב overnight trading).שימו לב כמה דברים מהטוויט הזה התגשמו - למשל שאין ROI על ההשקעות בGPU, וגם שאימון מודלים נהיה פתאום לא כזה קשה.
אני חושב שאנבידיה היא השורט הכי ברור בשוק לאור ההתפתחויות שיש, עם הכי מעט סיכון.
מה הסיכון שלי, שאנבידיה תהיה פתאום 7 טריליון ולא 3.5 טריליון? מצד שני, כמה סיכונים יש לאנבידיה? הרבה. קשה למנות. תחרות, האטה בצמיחה, גיהוק בביקוש... אולי AMD סוף סוף תתן פייט כמו שצריך?
בסופו של דבר אנבידיה חברה נהדרת. אין ספק. אבל קרה לה מה שקורה לא פעם לחברה נהדרת - היא משכה יותר מידי ע"ח העתיד, והאוברדרפט חזר לנשוך. גם טכנית - ההייפ מאחורינו, הקומודיטזציה של LLM הופכת להיות עובדה מוגמרת, ועכשיו כל מנהל רכש ישאל את עצמו 7 פעמים לפני שירכוש צ'יפ של אנבידיה במחיר מנופח.
 
  • הוסף לסימניות
  • #23
הנה פוסט לדוגמה מX

@Assaf_Nathan


לקח לי חצי שנה - אבל עכשיו אני יכול לומר שאני בשורט $NVDA מהבוקר (בוצע ב overnight trading).שימו לב כמה דברים מהטוויט הזה התגשמו - למשל שאין ROI על ההשקעות בGPU, וגם שאימון מודלים נהיה פתאום לא כזה קשה.
אני חושב שאנבידיה היא השורט הכי ברור בשוק לאור ההתפתחויות שיש, עם הכי מעט סיכון.
מה הסיכון שלי, שאנבידיה תהיה פתאום 7 טריליון ולא 3.5 טריליון? מצד שני, כמה סיכונים יש לאנבידיה? הרבה. קשה למנות. תחרות, האטה בצמיחה, גיהוק בביקוש... אולי AMD סוף סוף תתן פייט כמו שצריך?
בסופו של דבר אנבידיה חברה נהדרת. אין ספק. אבל קרה לה מה שקורה לא פעם לחברה נהדרת - היא משכה יותר מידי ע"ח העתיד, והאוברדרפט חזר לנשוך. גם טכנית - ההייפ מאחורינו, הקומודיטזציה של LLM הופכת להיות עובדה מוגמרת, ועכשיו כל מנהל רכש ישאל את עצמו 7 פעמים לפני שירכוש צ'יפ של אנבידיה במחיר מנופח.
ובמילים אחרות
חלק מהתמחור של nvidia היה כי חשבו שנצטרך בשנים הקרובות X כח מחשוב כדי להפעיל את כל הLLMים ולכן השקיעו בדור חדש של מעבדים וכו'
ועכשיו אנשים חוששים שהערכות היו מוגזמות ואולי יצטרכו רק רבע מהכח מחשוב ואלי גם לא יהיה יתרון אמיתי לnvidia בשוק כי גם שבב של המתחרים יעשה את העבודה
בפועל אני לא מופתע כי היה ברור שהמודל משתפרים עם הזמן, אבל אם המחיר האמיתי של nvidia אמור להיות באמת 20% פחות מהמחיר עכשיו אז אמור להיות עכשיו תיקון ושהשוק ירגע מההיפ מסביב nvidia מצד שני יתכן שהערכות לnvidia יהיו שעדיין יש להם יתרון והמניה תחזור ללמעלה....
 
  • הוסף לסימניות
  • #24
כל זה נכון
אבל אם נחשוב יותר בגדול -אנבידה יכולים גם לייעל את החומרה שלהם שתהיה זולה יותר
ומכיוון שבכל מקרה הביקוש יגבר-להם יש הכי הרבה מוניטין למכור

מה שכם אם מלכתחילה ההערכת שווי שלהם היתה מוגזמת מאוד-לזה אין פיתרון חוץ מתיקון...
ועליה איטית בהתאם למצבם-מה שאגב קורה כל הזמן בנאסדק
 
  • הוסף לסימניות
  • #25
מעניין לאיפה ילך העולם של השבבים החזקים
אם מודלי ai יוכלו לרוץ על שבבים רגילים, אנבדייה וחברות השבבים יצטרכו למצוא שימושים חדשים לשבבים החזקים, ואולי זה יביא לגל של המצאות/יכולות חדשות
 
  • הוסף לסימניות
  • #26
אבל אם נחשוב יותר בגדול -אנבידה יכולים גם לייעל את החומרה שלהם שתהיה זולה יותר
ומכיוון שבכל מקרה הביקוש יגבר-להם יש הכי הרבה מוניטין למכור
המחיר של השבבים שלהם היא לא העלות יצור אלא העלות תכנון וגם נתח יפה שמשאירים לעצמם
עכשיו אם לא יהיה ביקוש לBlackwell שהם תכננו לעשות עליו רווחים נאים והם ישארו עם אלפי יחידות במחסנים המניה תצנח משמעותית.
בקטע של המוניטין לא נראה לי שזה משמעותי כל כך
בסוף הלקוחות שקונים את הGPU בוחנים טוב כל שינוי בשוק וגם אם אתמול הGPU הכי טוב היה של חברה א' אם חברה ב' הכריזו עכיו על שבב חדש בחצי מחיר והציעו ביצועים טובים אין סיבה שלא יעברו לקנות את השבב של חברה ב' אא"כ חברה א' (nvidia במקרה הזה) הצליחו לנעול את הלקוחות עם תוכנה שרצה רק על הGPU שלהם (ולמתחרים יש פרוייקט שנועד למנוע את זה ולכתוב ספריות שמתאימות לכל המעבדים)
 
  • הוסף לסימניות
  • #27
מעניין לאיפה ילך העולם של השבבים החזקים
אם מודלי ai יוכלו לרוץ על שבבים רגילים, אנבדייה וחברות השבבים יצטרכו למצוא שימושים חדשים לשבבים החזקים, ואולי זה יביא לגל של המצאות/יכולות חדשות
לא השתמשו בשבבים "רגילים"
אלא בH800 (של אנבידיה)
החידוש הוא שהוא שהוא לא השבב הכי מתקדם שיש רק לחברות במערב
 
  • הוסף לסימניות
  • #28
כולם ניסו למצוא פתרונות,
אז ארה"ב פיתחה עט מיוחד שהדיו יירד גם ללא כח הכבידה, והשקיעה בזה חצי מליון דולר!
והרוסים - אה, הם ציידו את האסטורנאטים בעפרונות.....
ואז... כשהם הגיעו לחלל, הם גילו ששברי העופרת הקטנים שמשאיר העיפרון,
משייטים להם בנחת בהעדר כח הכבידה ונכנסים להם לעינים ולאוזניים....
 
  • הוסף לסימניות
  • #29
מה נראה לך השקר כאן?
הם השיגו כמויות GPU בדרך סודית?
את הביצועים של המודל אפשר לבדוק לבד כי הוא בקוד פתוח
אין לי מספיק יידע בשביל לשער איך סינים הצליחו לשקר. אין לי מושג.
כאשר יש לפני שתי אפשרויות: א. סינים שמו את כולם בכיס הקטן מבחינה טכנולוגית, ב. סינים הצליחו לשקר - אני נוטה לאפשרות השנייה.

לגבי הביצועים של המודל שאפשר לבדוק - לא מבין איך זה קשור. הם עשו מודל יפה מאוד (לא אתפלא עם גנבו משקלים או עוד טריק אחר), אבל הזעזוע הוא שהם הצליחו לאמן במודל במחיר מאוד זול. ואת זה אנחנו יודעים מדברים סינים עצמם.
 
  • הוסף לסימניות
  • #32
ניתוח מעניין

ההשפעה של התחרות ו-DeepSeek על Nvidia​


מאמר ארוך ומצוין מאת ג'פרי עמנואל המתאר את המצב הנוכחי בתעשיית הבינה המלאכותית ומודלי השפה הגדולים (LLM). הכותרת המקורית היא "המקרה לשורט על מניית Nvidia" - אני משתמש בכותרת החלופית מ-Hacker News, אך גם היא לא משקפת במלואה את עומק המאמר.


לג'פרי יש שילוב נדיר של ניסיון הן במדעי המחשב והן בניתוח השקעות. הוא משלב כאן את שני העולמות, מעריך את האתגרים של NVIDIA תוך מתן תובנות עמוקות למגוון נושאים רלוונטיים ומעניינים.


כפי שג'פרי מתאר זאת, החפיר התחרותי של NVIDIA מורכב מארבעה רכיבים: דרייברים איכותיים ללינוקס, CUDA כתקן תעשייתי, טכנולוגיית הקישוריות המהירה ל-GPU שהם רכשו מ-Mellanox בשנת 2019, ואפקט הגלגל המתגלגל שבו הם יכולים להשקיע את רווחיהם העצומים (75-90% מרווח במקרים מסוימים!) במחקר ופיתוח נוסף.


כל אחד מאלה נמצא תחת איום.


טכנולוגיות כמו MLX, Triton ו-JAX מערערות את היתרון של CUDA על ידי הקלה על מפתחי למידת מכונה לכוון למספר פלטפורמות - בנוסף, מודלי השפה הגדולים עצמם נעשים מספיק מתקדמים כדי לסייע בהעברת דברים לארכיטקטורות חלופיות.


קישוריות ה-GPU מסייעת למספר GPU לעבוד יחד על משימות כמו אימון מודלים. חברות כמו Cerebras מפתחות שבבים ענקיים שיכולים להשיג הרבה יותר על שבב בודד.


שולי הרווח של 75-90% מספקים תמריץ עצום לחברות אחרות להדביק את הפער - כולל הלקוחות שמוציאים הכי הרבה על NVIDIA כרגע - מיקרוסופט, אמזון, מטא, גוגל, אפל - כולן עם פרויקטי סיליקון פנימיים משלהן:


[תרגום ציטוט] "כעת, זה לא סוד שיש התפלגות חוק חזקה חזקה בבסיס הלקוחות ההיפר-סקלריים של Nvidia, כאשר קומץ הלקוחות העליונים מייצגים את חלק הארי של ההכנסות עם שולי רווח גבוהים. כיצד צריך לחשוב על עתיד העסק הזה כאשר ממש כל אחד מלקוחות ה-VIP האלה בונה שבבים מותאמים אישית משלו במיוחד לאימון והיסק של בינה מלאכותית?"


האמיתי של המאמר הזה הוא האופן שבו הוא מתאר פרטים טכניים של מודלי שפה גדולים מודרניים באופן נגיש יחסית. אני אוהב את התיאור הזה של טריקי ההיסק-בקנה-מידה שבהם משתמשים O1 ו-R1, בהשוואה לטרנספורמרים מסורתיים:


[תרגום ציטוט] "באופן בסיסי, האופן שבו טרנספורמרים עובדים מבחינת חיזוי האסימון הבא בכל שלב הוא שאם הם מתחילים ב'נתיב' רע בתגובה הראשונית שלהם, הם נעשים כמעט כמו ילד מתחמק שמנסה לטוות סיפור על למה הם בעצם צודקים, גם אם הם היו צריכים להבין באמצע בעזרת שכל ישר שמה שהם אומרים לא יכול להיות נכון."
המשך התרגום:

מכיוון שהמודלים תמיד מנסים להיות עקביים פנימית ושכל אסימון שנוצר יזרום באופן טבעי מהאסימונים והקונטקסט הקודמים, קשה להם מאוד לתקן כיוון ולחזור אחורה. על ידי פיצול תהליך ההיסק למה שלמעשה מהווה שלבי ביניים רבים, הם יכולים לנסות דברים רבים שונים ולראות מה עובד ולהמשיך לנסות לתקן כיוון ולנסות גישות אחרות עד שהם יכולים להגיע לסף ביטחון גבוה יחסית שהם לא מדברים שטויות.

הרבע האחרון של המאמר מדבר על גלי ההדף שמטלטלים את התעשייה כרגע שנגרמו על ידי DeepSeek v3 ו-R1
v3 נשאר המודל המדורג הראשון עם משקולות פתוחות, למרות שהוא יעיל פי 45 בערך באימון מהמתחרים שלו: חדשות רעות אם אתם מוכרים GPU!
R1 מייצג פריצת דרך עצומה נוספת ביעילות הן לאימון והן להיסק - ה-API של DeepSeek R1 זול כרגע פי 27 מ-o1 של OpenAI, עבור רמת איכות דומה.

ג'פרי סיכם חלק מהרעיונות המרכזיים ממאמר v3 כך:

[תרגום ציטוט] "חידוש עיקרי הוא מסגרת האימון בדיוק מעורב המתוחכמת שלהם שמאפשרת להם להשתמש במספרים בנקודה צפה 8-ביט (FP8) לאורך כל תהליך האימון. [...]

DeepSeek פיצחו את הבעיה הזו על ידי פיתוח מערכת חכמה שמפרקת מספרים לאריחים קטנים עבור אקטיבציות ובלוקים עבור משקולות, ומשתמשת באופן אסטרטגי בחישובים בדיוק גבוה בנקודות מפתח ברשת. בניגוד למעבדות אחרות שמאמנות בדיוק גבוה ואז מכווצות מאוחר יותר (ומאבדות חלק מהאיכות בתהליך), הגישה הטבעית של FP8 של DeepSeek משמעותה שהם מקבלים את החיסכון העצום בזיכרון בלי לפגוע בביצועים. כשאתה מאמן על פני אלפי GPU, ההפחתה הדרמטית הזו בדרישות הזיכרון לכל GPU מתורגמת לצורך בהרבה פחות GPU בסך הכל."

ואז עבור R1:

[תרגום ציטוט] "עם R1, DeepSeek למעשה פיצחו אחד מגביעי הקודש של בינה מלאכותית: גרימה למודלים לחשוב שלב-אחר-שלב בלי להסתמך על מאגרי נתונים מפוקחים ענקיים. הניסוי DeepSeek-R1-Zero שלהם הראה משהו מדהים: באמצעות למידת חיזוק טהורה עם פונקציות תגמול מעוצבות בקפידה, הם הצליחו לגרום למודלים לפתח יכולות חשיבה מתוחכמות באופן אוטונומי לחלוטין. זה לא היה רק על פתרון בעיות - המודל למד באופן אורגני לייצר שרשראות חשיבה ארוכות, לאמת את עבודתו בעצמו, ולהקצות יותר זמן חישוב לבעיות קשות יותר.

פריצת הדרך הטכנית כאן הייתה הגישה החדשנית שלהם למידול תגמול. במקום להשתמש במודלי תגמול עצביים מורכבים שיכולים להוביל ל'האקינג תגמול' (שבו המודל מוצא דרכים מזויפות להגדיל את התגמולים שלהם שלא באמת מובילות לביצועי מודל טובים יותר בעולם האמיתי), הם פיתחו מערכת מבוססת-חוקים חכמה שמשלבת תגמולי דיוק (אימות תשובות סופיות) עם תגמולי פורמט (עידוד חשיבה מובנית). הגישה הפשוטה יותר הזו התבררה כעמידה וניתנת להרחבה יותר ממודלי התגמול מבוססי-התהליך שאחרים ניסו."

המאמר הזה מלא בתובנות כאלה - שווה להקדיש את הזמן לספיגת כולו.
 
  • הוסף לסימניות
  • #33
אין לי מספיק יידע בשביל לשער איך סינים הצליחו לשקר. אין לי מושג.
כאשר יש לפני שתי אפשרויות: א. סינים שמו את כולם בכיס הקטן מבחינה טכנולוגית, ב. סינים הצליחו לשקר - אני נוטה לאפשרות השנייה.

לגבי הביצועים של המודל שאפשר לבדוק - לא מבין איך זה קשור. הם עשו מודל יפה מאוד (לא אתפלא עם גנבו משקלים או עוד טריק אחר), אבל הזעזוע הוא שהם הצליחו לאמן במודל במחיר מאוד זול. ואת זה אנחנו יודעים מדברים סינים עצמם.

על רקע הדברים הללו בבית ההשקעות לידר סימנו 3 תרחישים מרכזיים, וההשפעות שלהן על החברות הבינלאומיות והשווקים, בעיקר בארצות הברית.

התרחיש הראשון, הוא שהחברה שמה את ידיה על שבבי בינה מלאכותית מתקדמים של אנבידיה, אשר נרכשו בשוק השחור בניגוד לסנקציות האמריקאיות. כך שהעלות בפועל גבוהה בהרבה מהעלות המדווחת. לדברי לידר, תרחיש זה לא אמור להזיק למניות הטכנולוגיה האמריקאיות, שכן התוצאות מתבססות על אותם שבבים בהן הו עושות שימוש.

התרחיש השני הוא שהמודל הסיני אומן על בסיס מודלים אמריקאים קיימים. תרחיש זה, צפוי להיות שלילי עובר חברות כמו OpenAI ומטא, אך לא בהכרח משפיעים על כל השוק. שני התרחישים הללו, תואמים לפי לידר את היסטוריה של החברות והממשל הסיני שנגועים לעיתים בשקרים והעתקות.


לבסוף, התרחיש השלישי, לו הם מעניקים הסתברות נמוכה יותר, עשוי להביא לקטסטרופה בשוק. בתרחיש זה, החברה באמת הצליחה לייצר מודל תחרותי בעלות זולה ללא שבבים מתקדמים - מהווה את הדרמה המרכזית. במידה והחברה הצליחה לייצר תוצאות דומות ללא עלות כה גבוהה, נשאלת השאלה האם ההוצאות ההוניות בשווי מאות מיליארדי דולרים שהכריזו ענקיות הטכנולוגיה וגם הממשל האמריקאי (בתוכנית Stargate) באמת מוצדקים. קיצוץ בהוצאות אלו, יכה גלים בוול סטריט וצפוי לייצר דאונסייד אגרסיבי לכל מניות השבבים בדגש על אנבידיה וכמובן גם לנגזרות השניות שנהנו מהמגמה עד כה.
יש מצב שהירידה היא "רק" 12% כי השוק נותן הסתברות נמוכה שלא שקרו/גנבו/הבריחו , ואם באמת יש כאן פריצת דרך המניה תצלול?
 
  • הוסף לסימניות
  • #34
מ


יש מצב שהירידה היא "רק" 12% כי השוק נותן הסתברות נמוכה שלא שקרו/גנבו/הבריחו , ואם באמת יש כאן פריצת דרך המניה תצלול?
ברור שחברות אמריקאיות לא ישתמשו בטכנולוגיה סינית מחשש לריגול וכדו' כך שהשפעה ישירה אין
מה שכן אנשים מחשבים מחדש האם הסכומים שמושקעים בבינה הם מוצדקים ומכאן מגיע הירידה.
וחוצמזה החברות הגדולות בארה''ב 'יושבות' על המודל הזה להבין האם הכצעקתה או לא.
 
  • הוסף לסימניות
  • #35
אם לא מדובר בזיוף, זו כנראה הפעם הראשונה שהמערב משכפל קניין רוחני שמקורו בסין..
 
  • הוסף לסימניות
  • #36
מ

ברור שחברות אמריקאיות לא ישתמשו בטכנולוגיה סינית מחשש לריגול וכדו' כך שהשפעה ישירה אין
מה שכן אנשים מחשבים מחדש האם הסכומים שמושקעים בבינה הם מוצדקים ומכאן מגיע הירידה.
וחוצמזה החברות הגדולות בארה''ב 'יושבות' על המודל הזה להבין האם הכצעקתה או לא.
זה בקוד פתוח
למה שלא ישתמשו בזה?
ולכן גם לחברות במערב קל לשב ולנסות לנתח את המודל ולנסות להעתיק אותו
אבל אם הגענו למצב שבמערב מעתיקים מסין המצב קשה....
 
  • הוסף לסימניות
  • #37
פרופסור יאן לקון, אחד החוקרים הנחשבים בעולם ה-ML וה-AI, ומי שמרכז את מאמצי מטא בתחום אמר בתגובה להשקה של המודל של DeepSeek: "אנשים שרואים את הביצועים של DeepSeek וחושבים: 'סין עוקפת את ארה"ב בתחום ה-AI' – אתם מפרשים זאת לא נכון. הפירוש הנכון הוא: 'מודלים בקוד פתוח עוקפים מודלים סגורים'… דיפסיק הרוויחו ממחקר פתוח וקוד פתוח (לדוגמה, PyTorch ו-Llama של Meta). הם פיתחו רעיונות חדשים ובנו אותם על בסיס עבודות של אחרים. מכיוון שעבודתם פורסמה והיא בקוד פתוח, כולם יכולים להרוויח מכך. זו העוצמה של מחקר פתוח וקוד פתוח".

מקור
 
  • הוסף לסימניות
  • #38
אין לי מספיק יידע בשביל לשער איך סינים הצליחו לשקר. אין לי מושג.
כאשר יש לפני שתי אפשרויות: א. סינים שמו את כולם בכיס הקטן מבחינה טכנולוגית, ב. סינים הצליחו לשקר - אני נוטה לאפשרות השנייה.

לגבי הביצועים של המודל שאפשר לבדוק - לא מבין איך זה קשור. הם עשו מודל יפה מאוד (לא אתפלא עם גנבו משקלים או עוד טריק אחר), אבל הזעזוע הוא שהם הצליחו לאמן במודל במחיר מאוד זול. ואת זה אנחנו יודעים מדברים סינים עצמם.
בכתבה הזאת מסביר מבחינה טכנית את המספרים
DeepSeek טוענים במחקר שלהם
במהלך שלב האימון המקדים, אימון DeepSeek-V3 על כל טריליון טוקנים דורש רק 180 אלף שעות מעבד גרפי מסוג H800, כלומר 3.7 ימים במתחם המחשוב שלנו עם 2,048 מעבדים גרפיים מסוג H800. כתוצאה מכך, שלב האימון המקדים שלנו הושלם בפחות מחודשיים ועלה 2,664 אלף שעות מעבד גרפי. בשילוב עם 119 אלף שעות מעבד גרפי להרחבת אורך ההקשר ו-5 אלף שעות מעבד גרפי לאימון משלים, DeepSeek-V3 עולה רק 2.788 מיליון שעות מעבד גרפי עבור האימון המלא שלו. בהנחה שמחיר ההשכרה של מעבד גרפי מסוג H800 הוא 2 דולר לשעת מעבד גרפי, סך עלויות האימון שלנו מסתכמות ב-5.576 מיליון דולר בלבד. יש לציין כי העלויות הנזכרות לעיל כוללות רק את האימון הרשמי של DeepSeek-V3, ואינן כוללות את העלויות הקשורות למחקר מקדים וניסויי השוואה על ארכיטקטורות, אלגוריתמים או נתונים.
הכתב מתייחס לאלו שרוצה לפקפק על אמינות הטענות של DeepSeek
למעשה, נטל ההוכחה מוטל על המפקפקים, לפחות ברגע שמבינים את הארכיטקטורה של V3. זכרו את החלק על DeepSeekMoE: ל-V3 יש 671 מיליארד פרמטרים, אבל רק 37 מיליארד פרמטרים במומחה הפעיל מחושבים עבור כל טוקן; זה שווה ל-333.3 מיליארד פעולות צפות (FLOPS) של חישוב לטוקן. כאן עליי להזכיר חידוש נוסף של DeepSeek: בעוד שהפרמטרים אוחסנו בדיוק של BF16 או FP32, הם הופחתו לדיוק של FP8 לצורך החישובים; ל-2048 מעבדי H800 יש קיבולת של 3.97 אקסהפלופס, כלומר 3.97 מיליארד מיליארד FLOPS. סט האימון, בינתיים, הכיל 14.8 טריליון טוקנים; ברגע שעושים את כל החישובים המתמטיים, מתברר ש-2.8 מיליון שעות H800 מספיקות לאימון V3. שוב, זה היה רק הריצה הסופית, לא העלות הכוללת, אבל זה מספר סביר.
 
  • הוסף לסימניות
  • #39
בכתבה הזאת מסביר מבחינה טכנית את המספרים
DeepSeek טוענים במחקר שלהם

הכתב מתייחס לאלו שרוצה לפקפק על אמינות הטענות של DeepSeek
ובקיצור למי שאין כח למונחים הטכניים
המודל בקוד פתוח ואפשר לקחת שבב H800 ולבדוק לבד כמה יעלה לאמן מודל כזה מאפס.....
 
  • הוסף לסימניות
  • #40
בכתבה הזאת מסביר מבחינה טכנית את המספרים
DeepSeek טוענים במחקר שלהם

הכתב מתייחס לאלו שרוצה לפקפק על אמינות הטענות של DeepSeek
נראה לי שרק אם אתה נמצא עמוק עמוק בתחום, אולי אתה יכול להבין איך להתייחס לנאמר

אני מכיר מישהו שהמציע פטנט לדחיסה אפקטיבית מאוד של קבצים. הרבה יותר טוב מZIP ודומיו. הוא קיבל תקצוב שמן מאוד מחברת הייטק (משמע, מומחים בדקו את המוצר) בשביל להמשיך לפתח את המוצר.
זה היה מוצר מאוד מבטיח. ראו איך שקבצים ענקיים הצטמקו, ואחר כך השתחזרו בהצלחה, והכל במהירות עצומה.
הוא גם הסביר את התאוריה מאחורי זה - זה היה מבוסס על חישוב רצפים במספר PI. מרתק.
אלא מאי. בסוף הסתבר שהתוכנה שלו פשוט החביאה את הקובץ בתיקיה כל שהיא, ויצרה קובץ קטן חדש. וכשבאו לפתוח את הארכיון התוכנה פשוט הוציאה את הקובץ מהמחבוא.
 

פרוגבוט

תוכן שיווקי
פרסומת
החלפת המידע בפרום הינה בין משקיעים חובבנים, ואינה מהווה תחליף ליעוץ מקצועי.

פוסטים חדשים שאולי לא קראת....

הצטרפות לניוזלטר

איזה כיף שהצטרפתם לניוזלטר שלנו!

מעכשיו, תהיו הראשונים לקבל את כל העדכונים, החדשות, ההפתעות בלעדיות, והתכנים הכי חמים שלנו בפרוג!

לוח מודעות

הפרק היומי

הפרק היומי! כל ערב פרק תהילים חדש. הצטרפו אלינו לקריאת תהילים משותפת!


תהילים פרק כה

אלְדָוִד אֵלֶיךָ יי נַפְשִׁי אֶשָּׂא:באֱלֹהַי בְּךָ בָטַחְתִּי אַל אֵבוֹשָׁה אַל יַעַלְצוּ אֹיְבַי לִי:גגַּם כָּל קוֶֹיךָ לֹא יֵבֹשׁוּ יֵבֹשׁוּ הַבּוֹגְדִים רֵיקָם:דדְּרָכֶיךָ יי הוֹדִיעֵנִי אֹרְחוֹתֶיךָ לַמְּדֵנִי:ההַדְרִיכֵנִי בַאֲמִתֶּךָ וְלַמְּדֵנִי כִּי אַתָּה אֱלֹהֵי יִשְׁעִי אוֹתְךָ קִוִּיתִי כָּל הַיּוֹם:וזְכֹר רַחֲמֶיךָ יי וַחֲסָדֶיךָ כִּי מֵעוֹלָם הֵמָּה:זחַטֹּאות נְעוּרַי וּפְשָׁעַי אַל תִּזְכֹּר כְּחַסְדְּךָ זְכָר לִי אַתָּה לְמַעַן טוּבְךָ יי:חטוֹב וְיָשָׁר יי עַל כֵּן יוֹרֶה חַטָּאִים בַּדָּרֶךְ:טיַדְרֵךְ עֲנָוִים בַּמִּשְׁפָּט וִילַמֵּד עֲנָוִים דַּרְכּוֹ:יכָּל אָרְחוֹת יי חֶסֶד וֶאֱמֶת לְנֹצְרֵי בְרִיתוֹ וְעֵדֹתָיו:יאלְמַעַן שִׁמְךָ יי וְסָלַחְתָּ לַעֲוֹנִי כִּי רַב הוּא:יבמִי זֶה הָאִישׁ יְרֵא יי יוֹרֶנּוּ בְּדֶרֶךְ יִבְחָר:יגנַפְשׁוֹ בְּטוֹב תָּלִין וְזַרְעוֹ יִירַשׁ אָרֶץ:ידסוֹד יי לִירֵאָיו וּבְרִיתוֹ לְהוֹדִיעָם:טועֵינַי תָּמִיד אֶל יי כִּי הוּא יוֹצִיא מֵרֶשֶׁת רַגְלָי:טזפְּנֵה אֵלַי וְחָנֵּנִי כִּי יָחִיד וְעָנִי אָנִי:יזצָרוֹת לְבָבִי הִרְחִיבוּ מִמְּצוּקוֹתַי הוֹצִיאֵנִי:יחרְאֵה עָנְיִי וַעֲמָלִי וְשָׂא לְכָל חַטֹּאותָי:יטרְאֵה אוֹיְבַי כִּי רָבּוּ וְשִׂנְאַת חָמָס שְׂנֵאוּנִי:כשָׁמְרָה נַפְשִׁי וְהַצִּילֵנִי אַל אֵבוֹשׁ כִּי חָסִיתִי בָךְ:כאתֹּם וָיֹשֶׁר יִצְּרוּנִי כִּי קִוִּיתִיךָ:כבפְּדֵה אֱלֹהִים אֶת יִשְׂרָאֵל מִכֹּל צָרוֹתָיו:
נקרא  2  פעמים
למעלה