Ahmed Kamel - Data Analyst

Ahmed Kamel - Data Analyst Data Analyst skilled in Python, SQL, Excel, and Power BI, passionate about transforming data into actionable insights.

🚀 A New Chapter Begins — Welcome to DataGrandMaster!After spending a lot of time learning and working with Data Analysis...
01/09/2026

🚀 A New Chapter Begins — Welcome to DataGrandMaster!

After spending a lot of time learning and working with Data Analysis, Statistics, and Machine Learning, I’m excited to finally launch a project I’ve been thinking about for a long time:

🎓 DataGrandMaster
A YouTube channel dedicated to making Statistics & Data Analysis easier to understand through visual storytelling and animation.

📊 We’ll start from the fundamentals and gradually move toward more advanced topics:

• What is Data?
• Descriptive Statistics
• Probability
• Probability Distributions
• Hypothesis Testing
• Correlation & Regression
• Statistical Inference
• Machine Learning Concepts
• And much more…

🎬 The first video is officially LIVE!
My goal is not just to explain formulas and definitions, but to make concepts visual, intuitive, and memorable using animation and visual explanations.

If you're interested in:

📊 Statistics
📈 Data Analysis
🐍 Python
🤖 Machine Learning
🧠 Data Science

…I'd love to have you as one of the first subscribers to DataGrandMaster.

👉 Subscribe to the channel:

https://youtu.be/8gnI1R69plI?si=Tb2fUMpOnY00DY0l

And if you know someone who's learning Data Analysis or Statistics, feel free to share this post with them. ❤️

This is just the beginning.
Let’s learn Data — one concept at a time. 🚀

What is data, and why is it the foundation of data analysis?In th...

📊 Non-Parametric Tests — When Your Data Doesn’t Follow the RulesImagine you want to compare the satisfaction scores of c...
31/08/2026

📊 Non-Parametric Tests — When Your Data Doesn’t Follow the Rules

Imagine you want to compare the satisfaction scores of customers from two different stores.
You collect the scores:
Store A: 2, 3, 3, 4, 5, 5, 5, 5
Store B: 1, 2, 2, 2, 3, 4, 4, 5
A common question is:

“Is there a statistically significant difference between the two groups?”

You might immediately think about a t-test.
But there’s a problem...
What if your data doesn't satisfy the assumptions required by the t-test?
For example:

The data is strongly skewed.

There are extreme outliers.

The sample size is small.

The variable is ordinal rather than truly continuous.

The normality assumption is not reasonable.

This is where Non-Parametric Tests become useful.

🧠 What is a Non-Parametric Test?

A non-parametric test is a statistical test that generally makes fewer assumptions about the underlying distribution of the data than many parametric tests.

Instead of relying heavily on the actual numerical values, many non-parametric methods work with the ranks (relative ordering) of the observations.

For example:
Data:
10, 20, 30, 40

Their ranks are:
1, 2, 3, 4
The test can then analyze the ordering of the observations rather than depending on the assumption that the original data follows a normal distribution.

🎯 A Simple Example

Suppose two groups rate a product from 1 to 5:
Group A:
1, 2, 2, 3, 5

Group B:
3, 4, 4, 5, 5
Because the rating scale is ordinal, the difference between 1 and 2 isn't necessarily the same as the difference between 4 and 5.
Instead of using a t-test, we might consider a:

Mann–Whitney U Test

This test compares two independent groups using the ranks of their observations.
So instead of asking:

“What is the difference between the means?”

we're essentially asking:

“Do observations from one group tend to have higher ranks than observations from the other group?”


⚠️ Does “Non-Parametric” Mean “No Assumptions”?

No.
This is a common misconception.
Non-parametric tests don't mean:

“You can use them with any data without checking anything.”

They still have assumptions.
For example, the Mann–Whitney U test has assumptions related to independence and the nature of the distributions.

So the correct idea is:
Parametric ≠ always better
Non-parametric ≠ assumption-free
The right test depends on your research question, study design, measurement scale, and assumptions.

🔑 The Big Picture

Think of statistical tests as different tools in a toolbox 🧰.
You don't choose a tool simply because it is more advanced.

You choose it because it fits the data and the question you're asking.

Sometimes your data doesn't meet the assumptions of a parametric test.

That's when a Non-Parametric Test may be the better choice.
And that's an important lesson in Statistics:

Don't choose the statistical test first. Understand your data and research question first.

🧠 Bayes' Theorem — لما معلومة جديدة تغيّر الاحتمال!تخيل إنك عملت اختبار طبي لمرض معين.الاختبار طلع Positive.السؤال الطبي...
30/08/2026

🧠 Bayes' Theorem — لما معلومة جديدة تغيّر الاحتمال!

تخيل إنك عملت اختبار طبي لمرض معين.
الاختبار طلع Positive.
السؤال الطبيعي اللي ممكن تسأله:

"طيب، إيه احتمال إني فعلًا مصاب بالمرض؟"

ممكن تفتكر إن الإجابة ببساطة هي: 99% لأن الاختبار دقيق جدًا.
لكن هنا فيه مشكلة مهمة جدًا:
دقة الاختبار مش هي نفسها احتمال إصابتك بالمرض بعد ظهور النتيجة.
وهنا بييجي دور Bayes' Theorem.

🎯 مثال بسيط

لنفترض إن:

انتشار المرض في المجتمع = 1%

الاختبار يعطي Positive لـ 99% من المصابين.

لكنه يعطي Positive كاذب لـ 5% من الأشخاص الأصحاء.

دلوقتي شخص اختباره Positive.
إيه احتمال إنه مصاب فعلًا؟
خلينا نفكر في 10,000 شخص:
🧑‍⚕️ من الـ10,000:
100 شخص مصاب
ومنهم:
→ 99 هيظهر عندهم Positive ✅
أما الـ9,900 شخص السليمين:
→ 5% منهم = 495 شخص
هيظهر عندهم Positive رغم إنهم سليمين ❌
إذن إجمالي الـPositive:
99 + 495 = 594
لكن المصابين فعلًا بينهم:
99 شخص فقط
إذن:
P(Disease | Positive) = 99 / 594 ≈ 16.7%
😮 رغم إن الاختبار يكتشف 99% من المصابين، فإن الشخص الذي ظهرت نتيجته Positive لديه احتمال حوالي 16.7% فقط أن يكون مصابًا، وفقًا لهذه الافتراضات.

🔑 وهنا تظهر قوة Bayes' Theorem

Bayes' Theorem بتساعدنا نحدّث احتمالنا لحدث معين بعد ما نحصل على معلومة أو Evidence جديدة.
بمعنى أبسط:
Prior Probability
⬇️
احتمالنا قبل المعلومة
Evidence
⬇️
المعلومة الجديدة
Posterior Probability
⬇️
الاحتمال بعد تحديث اعتقادنا بالمعلومة الجديدة

📊 وده مش خاص بالطب فقط!

Bayes' Theorem موجود في تطبيقات كتير جدًا:
🔹 Spam Detection
هل الإيميل Spam بناءً على الكلمات الموجودة فيه؟
🔹 Machine Learning
تحديث احتمالات الـClasses بناءً على الـFeatures.
🔹 Fraud Detection
ما احتمال إن المعاملة Fraud بعد ظهور سلوك معين؟
🔹 Recommendation Systems
إزاي نحدّث توقعاتنا بناءً على سلوك المستخدم؟

🧠 الخلاصة

Bayes' Theorem = طريقة لتحديث الاحتمالات عندما نحصل على معلومات جديدة.
وأهم درس هنا:

مش كل Positive Result معناه إن احتمال حدوث الشيء كبير.

لازم نسأل دائمًا:
"كان الاحتمال كام قبل ما أعرف المعلومة؟"
لأن Base Rate / Prior Probability ممكن تغيّر النتيجة بشكل كبير.

⚠️ Type I vs Type II Error — لما الاختبار الإحصائي يغلط!تخيل إن عندك اختبار طبي بيحاول يكتشف إذا كان شخص مصاب بمرض معين ...
28/08/2026

⚠️ Type I vs Type II Error —
لما الاختبار الإحصائي يغلط!

تخيل إن عندك اختبار طبي بيحاول يكتشف إذا كان شخص مصاب بمرض معين أم لا.
الاختبار ممكن يطلع نتيجتين:

الشخص مصاب بالفعل ✅

الشخص غير مصاب ✅

لكن المشكلة إن الاختبار ممكن يخطئ.
وهنا بيظهر عندنا نوعين مهمين جدًا من الأخطاء:

🔴 Type I Error

يعني الاختبار قال:

"الشخص مصاب"

لكن الحقيقة إنه غير مصاب.
يعني عملنا False Positive.

📌 مثال:
شخص سليم → الاختبار قال إنه مصاب.
ده ممكن يؤدي لفحوصات إضافية، قلق غير ضروري، أو علاج غير مطلوب.

🔵 Type II Error

العكس تمامًا.
الاختبار قال:

"الشخص غير مصاب"

لكن الحقيقة إنه مصاب.
يعني حصل False Negative.

📌 مثال:
شخص مصاب → الاختبار قال إنه سليم.
وده ممكن يكون أخطر، لأنه قد يؤدي إلى عدم اكتشاف المرض في الوقت المناسب.

🧠 طب إزاي تفرق بينهم بسهولة؟

افتكرها كده:
Type I = False Alarm 🚨
أنت قلت "في مشكلة"، لكن مفيش مشكلة.

Type II = Missed Detection 🕵️
أنت قلت "مفيش مشكلة"، لكن المشكلة موجودة فعلًا.

🎯 مثال آخر من الـ Data Science

تخيل إن عندك Model بيكتشف Fraudulent Transactions.
عملية سليمة → Model قال Fraud ❌
➡️ Type I Error

عملية احتيالية → Model قال إنها سليمة ❌
➡️ Type II Error

وهنا اختيارك بين تقليل Type I أو Type II يعتمد على تكلفة كل خطأ.

لو الـFraud خطير جدًا، ممكن نهتم أكثر بتقليل الـFalse Negatives.

ولو إيقاف معاملات العملاء السليمة مكلف جدًا، هنحاول نقلل الـFalse Positives.

📊 وعلاقتهم بالـ Hypothesis Testing

في الإحصاء بنبدأ عادةً بـ:
H₀: Null Hypothesis
لو حصل:
Type I Error
نرفض H₀ رغم إنها صحيحة.

Type II Error
لا نرفض H₀ رغم إنها خاطئة.
وعشان كده:
α (Alpha) = Probability of Type I Error
بينما:
β (Beta) = Probability of Type II Error
والـ Statistical Power تساوي:
Power = 1 − β

🔑 ببساطة

:
Type I → False Positive
Type II → False Negative

وفهم الفرق بينهم مهم جدًا في Hypothesis Testing, Medical Diagnosis, A/B Testing, Classification وغيرها من تطبيقات الإحصاء والـData Science.

🎯 Conditional Probability — الاحتمال الشرطيتخيل إنك سألت مجموعة من 100 طالب:60 طالب بيدرسوا Python 🐍40 طالب بيدرسوا SQL2...
26/08/2026

🎯 Conditional Probability — الاحتمال الشرطي

تخيل إنك سألت مجموعة من 100 طالب:

60 طالب بيدرسوا Python 🐍

40 طالب بيدرسوا SQL

25 طالب بيدرسوا Python و SQL معًا

دلوقتي سألتك:

ما احتمال إن طالب بيدرس SQL بشرط إننا عرفنا بالفعل إنه بيدرس Python؟

هنا إحنا مش بنحسب الاحتمال على الـ100 طالب كلهم.
إحنا بنركز فقط على الطلاب اللي بيدرسوا Python.
يعني بقى عندنا 60 طالب فقط.
ومنهم 25 بيدرسوا SQL.
إذن:
P(SQL | Python) = 25 / 60 ≈ 41.7%
وده بالضبط هو مفهوم:

📌 Conditional Probability

الـ Conditional Probability هو:

احتمال حدوث حدث A بشرط إننا عرفنا إن حدث B قد حدث بالفعل.

بمعنى أبسط:
معلومة جديدة عرفناها → غيّرت مجموعة الحالات اللي بنحسب عليها الاحتمال.
فـ:
P(A | B)
نقرأها:

احتمال A بشرط حدوث B.

🎲 مثال من الحياة

لنفترض إن عندك 100 عميل:

70 عميل اشتروا المنتج.

30 عميل لم يشتروا.

من الـ70 اللي اشتروا، 50 استخدموا Discount Coupon.

لو سألناك:

ما احتمال إن العميل استخدم Coupon بشرط إنه اشترى المنتج؟

مش هنستخدم الـ100 عميل.
هننظر فقط إلى الـ70 عميل اللي اشتروا.
إذن:
P(Coupon | Purchased) = 50 / 70 ≈ 71.4%

🧠 الفرق المهم

Probability:

ما احتمال إن العميل يشتري؟

بننظر لكل العملاء.
Conditional Probability:

ما احتمال إن العميل يستخدم Coupon، إذا كنا نعرف بالفعل إنه اشترى؟

هنا بنغيّر مجموعة الحالات اللي بنحسب عليها الاحتمال.
وده من أهم المفاهيم اللي هتقابلك بعد كده في:
Bayes' Theorem → Machine Learning → Classification → Medical Diagnosis → A/B Testing
لأن المعلومة الجديدة اللي عرفناها ممكن تغيّر الاحتمال بشكل كبير. 📊

🔑 الخلاصة

Conditional Probability = احتمال حدوث شيء بعد معرفة معلومة معينة.
وأهم سؤال تسأله لنفسك:

"أنا بحسب الاحتمال بالنسبة لمين؟"

لأن بمجرد ما يظهر عندك "بشرط أن..."، غالبًا أنت بتتعامل مع Conditional Probability.

#الاحتمالات

🧠 MLE و Bayes' Theorem شكلهم مختلف... لكن في العمق بيدوروا حوالين نفس السؤال:"بناءً على البيانات اللي شوفتها — إيه اللي ...
25/08/2026

🧠 MLE و Bayes' Theorem

شكلهم مختلف... لكن في العمق بيدوروا حوالين نفس السؤال:

"بناءً على البيانات اللي شوفتها — إيه اللي المفروض أعتقده عن Parameters بتاعة الـ Model؟"

الـ MLE بيديك إجابة، والـ Bayesian Inference بيديك إجابة تانية.

وفهم العلاقة بينهم مهم جدًا لأي حد عايز يفهم الـ Statistics والـ Machine Learning بعمق، مش مجرد يشغّل Models. 👇

📌 نبدأ من نفس النقطة
الـ MLE والـ Bayesian Inference مرتبطين بـ Bayes' Theorem:
P(θ | data) = P(data | θ) × P(θ) / P(data)
ببساطة:
Posterior = Likelihood × Prior / Evidence
يعني:
→ P(θ | data) — Posterior:
إحنا بقينا نعتقد إيه عن θ بعد ما شفنا البيانات؟

→ P(data | θ) — Likelihood:
البيانات دي احتمالية ظهورها قد إيه لو θ له قيمة معينة؟

→ P(θ) — Prior:
كنا معتقدين إيه عن θ قبل ما نشوف البيانات؟

→ P(data) — Evidence:
عامل التطبيع اللي بيخلّي الـ Posterior Distribution مجموعها/تكاملها = 1.

وهنا تبدأ الاختلافات بين MLE و MAP و Full Bayes.

📌 MLE — الـ Likelihood هو كل حاج

الـ Maximum Likelihood Estimation (MLE) بيقول:
"خليني أشوف البيانات بس، وأختار قيمة الـ parameter اللي تخلي البيانات اللي شفتها هي الأكثر احتمالًا."
يعني:
θ_MLE = argmax P(data | θ)

مفيش Prior يدخل في الحساب.
مفيش افتراض عن θ قبل البيانات.
التركيز كله على:
إيه الـ θ اللي يفسّر البيانات بشكل أفضل؟

وده متوافق مع الـ Frequentist View:
الـ Parameters تعتبر قيم ثابتة لكن إحنا مش عارفينها، والـ Data هي اللي بتتغير عشوائيًا.

✅ الميزة: بسيط، سريع، وبيشتغل كويس جدًا مع الـ Large Datasets.
⚠️ العيب: مع البيانات القليلة، ممكن الـ estimate يبقى غير مستقر أو يتأثر بالـ noise، لأنه مش بيستخدم أي معلومات سابقة عن الـ parameters.

📌 MAP — حلقة الوصل بين MLE و Bayes

الـ Maximum A Posteriori (MAP) بياخد خطوة ناحية الـ Bayesian Inference.

بدل ما نعظّم الـ Likelihood بس، بنعظّم الـ Posterior:
θ_MAP = argmax P(θ | data)
وبما إن:
P(θ | data) ∝ P(data | θ) × P(θ)
فإحنا بنستخدم:
Data + Prior
الـ Prior هنا بيأثر على الـ estimate وبيشتغل بشكل مشابه لفكرة الـ Regularization.

⭐ وده بيقودنا لفكرة مهمة جدًا:

لو استخدمت Gaussian Prior على الـ parameters، فالـ MAP estimation يرتبط رياضيًا بـ Ridge Regression (L2 Regularization).

ولو استخدمت Laplace Prior، فالـ MAP estimation يرتبط بـ Lasso Regression (L1 Regularization).
يعني الـ Regularization مش مجرد "حركة عشان أمنع الـ Overfitting".

ممكن تشوفه كمان على إنه طريقة لإدخال Prior Beliefs في الـ Model.

📌 Full Bayesian Inference —
مش لازم نختار θ واحدة!

الـ Full Bayes بياخد الموضوع خطوة أبعد.
بدل ما نختار أفضل قيمة واحدة للـ parameter، بنحسب التوزيع الكامل للـ Posterior:
P(θ | data) ∝ P(data | θ) × P(θ)

وبالتالي:
→ مش بتاخد قيمة واحدة لـ θ بس
→ بتعرف إيه القيم الأكثر احتمالًا
→ تقدر تقيس Uncertainty في الـ parameters
→ والـ Predictions نفسها تقدر تاخد في اعتبارها كل القيم المعقولة للـ parameters

✅ الميزة: بيديك صورة أوضح عن الـ uncertainty، وده مفيد جدًا خصوصًا مع البيانات القليلة.
⚠️ العيب: Computationally أكثر تكلفة، واختيار الـ Prior محتاج يكون مدروس.

📌 الصورة كاملة
ممكن تبص عليهم كأنهم Spectrum:
MLE → MAP → Full Bayes
🔹 MLE:
الـ Prior مش موجود.
Data فقط.

🔹 MAP:
Data + Prior،
لكن في النهاية بناخد Point Estimate واحدة.

🔹 Full Bayes:
Data + Prior، لكن بنحتفظ بالـ Full Posterior Distribution وبالتالي بنحتفظ بالـ Uncertainty.

📌 طيب إيه اللي بيحصل لما الـ Data تكبر؟

لما يكون عندك Large Amount of Data، تأثير الـ Prior غالبًا بيقل، والـ Likelihood يبدأ يسيطر.

وبالتالي، تحت الشروط المناسبة، الـ MLE والـ MAP والـ Bayesian Estimates بيقربوا من بعض.

أما لما يكون عندك Small Dataset، الـ Prior ممكن يكون له تأثير أكبر.

وده مش معناه إن:
❌ "Bayes دايمًا أفضل مع البيانات القليلة"
لكن معناه إن Bayesian Inference بيخلي تأثير الـ Prior والـ Uncertainty ظاهرين بشكل صريح بدل ما يتجاهلهم.

📌 الصورة الأكبر

MLE و MAP و Bayesian Inference مش بالضرورة Models متنافسة.

هم طرق مختلفة للتعامل مع نفس المشكلة:
إحنا نعرف إيه عن الـ Parameters؟
وإيه اللي بتقوله البيانات؟
وقد إيه إحنا متأكدين من الـ Answer؟

والاختيار بينهم بيعتمد على:
→ حجم البيانات
→ طبيعة المشكلة
→ هل عندك Prior Knowledge موثوق؟
→ هل محتاج Point Estimate ولا Uncertainty كاملة؟
→ والـ Computational Resources المتاحة

💡 الـ Data Scientist الشاطر مش بيختار MLE أو Bayes لمجرد إنه متعود عليهم.

هو الأول بيفهم الـ assumptions وبيحدد هو محتاج إيه من الـ Model، وبعدها يختار الـ framework المناسب.

🎲 Every complex probability distribution has a humble origin.The Poisson distribution — used in fraud detection, queuing...
24/08/2026

🎲 Every complex probability distribution has a humble origin.

The Poisson distribution — used in fraud detection, queuing systems, and rare event modeling — doesn't appear out of nowhere.

It is born from the simplest random experiment imaginable:
A single coin flip.

Let me show you the full journey. 👇

📌 STEP 1 — THE BERNOULLI DISTRIBUTION

Start with the simplest possible experiment:
One trial. Two outcomes. Success or Failure.

A random variable X follows a Bernoulli distribution if:
→ X = 1 with probability p (success)
→ X = 0 with probability 1-p (failure)

P(X = x) = p^x × (1-p)^(1-x) , x ∈ {0, 1}

Mean: E[X] = p
Variance: Var(X) = p(1-p)

Examples:
→ Is this email spam? (Yes / No)
→ Does this patient have the disease? (Yes / No)
→ Did the customer click the ad? (Yes / No)

One trial. One parameter. Maximum simplicity.

📌 STEP 2 — THE BINOMIAL DISTRIBUTION

Now repeat that Bernoulli trial n times independently.

How many successes do you get out of n trials?

That's the Binomial distribution:
X ~ Binomial(n, p)

P(X = k) = C(n,k) × p^k × (1-p)^(n-k)

Mean: E[X] = np
Variance: Var(X) = np(1-p)

Examples:
→ Out of 100 emails, how many are spam?
→ Out of 1000 patients, how many test positive?
→ Out of 500 ad impressions, how many result in a click?

The Binomial is simply n independent Bernoulli trials stacked together.

📌 STEP 3 — THE SPECIAL CASE THAT BECOMES POISSON

Now ask a different question:

What happens when:
→ n → ∞ (trials become very large)
→ p → 0 (each trial is very unlikely to succeed)
→ But np = λ remains constant (the average count stays fixed)

In other words: rare events happening over a very large number of opportunities.

Take the Binomial formula and apply these limits:

lim(n→∞) C(n,k) × p^k × (1-p)^(n-k)

After substituting p = λ/n and taking the limit:

P(X = k) = (e^-λ × λ^k) / k!

That is exactly the Poisson distribution.

X ~ Poisson(λ)

Mean: E[X] = λ
Variance: Var(X) = λ

💡 Notice something beautiful:
In Poisson, Mean = Variance = λ
This equality is the signature of the Poisson distribution.

📌 WHEN TO USE POISSON

Poisson models the number of times a rare event occurs in a fixed interval of time or space.

Real-world examples:
→ How many fraud transactions occur per hour?
→ How many customers arrive at a bank per minute?
→ How many defects appear per square meter of fabric?
→ How many goals are scored per football match?

The key conditions:
✅ Events occur independently
✅ Average rate λ is constant
✅ Two events cannot occur at the exact same instant

📌 THE FULL JOURNEY

Bernoulli → one trial, binary outcome

Binomial → n trials, count successes

Poisson → n→∞, p→0, np=λ fixed → rare events at a constant rate

Each step is not a new idea.
It is the previous idea pushed to its natural limit.

The best way to understand any distribution is not to memorize its formula.
It's to understand where it comes from — and what question it was designed to answer. 💡

📊 EDA — قبل ما تبني أي Model، لازم تفهم بياناتككتير من الـ Beginners أول ما يستلموا Dataset يعملوا إيه؟يفتحوا Python...و...
21/08/2026

📊 EDA — قبل ما تبني أي Model، لازم تفهم بياناتك

كتير من الـ Beginners أول ما يستلموا Dataset يعملوا إيه؟
يفتحوا Python...
ويبدأوا يبنوا Model. 🤖

لكن فيه خطوة أهم من الـ Modeling نفسه:
🔥 Exploratory Data Analysis — EDA
━━━━━━━━━━━━━━━

📌 يعني إيه EDA؟

ببساطة، الـ EDA هي عملية إنك:

تستكشف بياناتك وتحاول تفهمها قبل ما تبدأ تبني النموذج.

يعني بدل ما تسأل:
❌ "أي Model أستخدم؟"
ابدأ بـ:

"أنا عندي بيانات شكلها إيه أصلًا؟"

━━━━━━━━━━━━━━━

📌 أول سؤال: البيانات شكلها إيه؟

تبدأ بـ:
✔ عدد الصفوف
✔ عدد الـ Features
✔ أنواع البيانات
✔ Missing Values
✔ Duplicate Records
مثلاً تكتشف إن عندك:
100,000 rows
لكن Feature مهمة فيها:
🚨 40% Missing Values
المعلومة دي ممكن تغير طريقة تعاملك مع البيانات بالكامل.
━━━━━━━━━━━━━━━

📌 بعد كده... نفهم الـ Variables

اسأل:
هل الـ Feature دي:
🔹 Numerical
🔹 Categorical
🔹 Ordinal
🔹 Date/Time
لأن كل نوع من البيانات محتاج طريقة مختلفة في التحليل.
━━━━━━━━━━━━━━━

📌 وبعدها نشوف Distribution

مثلاً عندك:
💰 Customer Income
ممكن تكتشف إن معظم العملاء دخلهم متوسط...
لكن فيه عدد قليل جدًا عنده دخل ضخم.
هنا الـ Mean ممكن يكون مضلل.
وتبدأ تسأل:
🤔 هل البيانات Skewed؟
🤔 هل فيه Outliers؟
🤔 هل Transformation ممكن تكون مفيدة؟
━━━━━━━━━━━━━━━

📌 العلاقات بين الـ Features

هنا الـ EDA تبدأ تبقى interesting فعلًا. 👀
مثلاً:
📈 هل Salary مرتبط بـ Spending؟
📉 هل Age مرتبط بـ Churn؟
🔗 هل فيه Features مرتبطة ببعض جدًا؟
ممكن تستخدم:
✔ Correlation
✔ Scatter Plots
✔ Box Plots
✔ Histograms
عشان تكتشف العلاقات دي.
━━━━━━━━━━━━━━━

🚨 والأهم... دور على المشاكل

EDA مش هدفها إنك تعمل Graphs حلوة.
هدفها إنك تكتشف المشاكل قبل الـ Modeling.
مثلاً:
❌ Missing Values
❌ Outliers
❌ Duplicates
❌ Incorrect Data Types
❌ Impossible Values
❌ Highly Skewed Features
❌ Data Leakage
❌ Strongly Correlated Features
كل مشكلة من دول ممكن تأثر على الـ Model.
━━━━━━━━━━━━━━━

📌 مثال بسيط

تخيل إنك بتبني Model يتوقع:
House Prices 🏠
أثناء الـ EDA اكتشفت إن:
House_Area = 5000 m²
لكن معظم البيوت في Dataset مساحتها:
100–300 m².
هنا لازم تسأل:
🤔
هل ده بيت فعلاً؟
ولا Data Entry Error؟
ولا Outlier حقيقي؟
لو تجاهلت السؤال...
ممكن المشكلة تنتقل معاك للـ Model.
━━━━━━━━━━━━━━━

📌 EDA مش مجرد Visualization

دي نقطة مهمة جدًا.
EDA تشمل:
📊 Statistical Analysis
📈 Visualization
🔎 Data Quality Checks
🧠 Finding Patterns
❓ Asking Questions
EDA هي عملية Investigation أكثر من كونها مجرد رسم Charts.
━━━━━━━━━━━━━━━
🎯 الخلاصة
قبل ما تقول:

"هستخدم Random Forest."

أو:

"XGBoost هيكون أفضل."

اسأل الأول:
"أنا فاهم بياناتي أصلًا؟"
لأن الـ Model مهما كان قوي...
لو البيانات فيها مشاكل،
الموديل مش هيصلحها بالسحر.

🔥 Good Data Science starts with understanding the data.

📉 PCA In Machine Learning.إزاي نقلل حجم الداتا من غير ما نفقد الصورة الكبيرة؟في الـData Science، مش معنى إن عندك Feature...
21/08/2026

📉 PCA In Machine Learning.

إزاي نقلل حجم الداتا من غير ما نفقد الصورة الكبيرة؟

في الـData Science، مش معنى إن عندك Features أكتر = Model أحسن.

أحيانًا الداتا بتكون فيها:

• Variables مرتبطة ببعض جدًا 🔗
• معلومات مكررة
• Noise ممكن يأثر على أداء الـModel
• Features كتير جدًا تخلي التعامل مع الداتا أصعب

وهنا بييجي دور:

🧠 PCA — Principal Component Analysis

الـPCA هي تقنية بتستخدم لتقليل عدد الـDimensions في الداتا.

ببساطة، بتاخد الـFeatures الأصلية وتحولها لمجموعة جديدة من المتغيرات اسمها:
👉 Principal Components

والـComponents دي بتحاول تحتفظ بأكبر قدر ممكن من التباين (Variance) الموجود في الداتا.
━━━━━━━━━━━━━━
🎯 طيب PCA بتعمل إيه بالظبط؟

ممكن تساعدنا في:

✅ تقليل الـRedundancy
✅ تقليل عدد الـFeatures
✅ تسريع بعض عمليات التدريب والحسابات
✅ تسهيل Visualization
✅ تقليل تأثير الـNoise في بعض الحالات
✅ وأحيانًا تقلل Overfitting

فكر فيها كده:

PCA بتحاول تضغط الداتا، مع الاحتفاظ بأكبر قدر ممكن من المعلومات المهمة.

━━━━━━━━━━━━━━
📊 مثال بسيط

تخيل عندك Dataset فيها 100 Feature بتوصف سلوك العملاء.

بدل ما تدخل الـ100 Feature كلهم للـModel، ممكن الـPCA تحولهم مثلًا لـ:

👉 10–15 Principal Components
مع الاحتفاظ بحوالي 95% من الـVariance.

فتبقى عندك:

⚡ حسابات أقل
🧹 داتا أبسط
📊 Visualization أسهل
🔍 Patterns أوضح
━━━━━━━━━━━━━━
🧩 طيب إيه حكاية الـPrincipal Components؟

أول Principal Component بيحاول يلتقط أكبر قدر من الـVariance في الداتا.

الـSecond Principal Component يلتقط أكبر قدر ممكن من الـVariance المتبقي، مع الحفاظ على إنه يكون Orthogonal للأول.

وبنفضل نكرر العملية دي مع باقي الـComponents.
━━━━━━━━━━━━━━
🌍 PCA بتستخدم فين؟

ممكن تلاقيها في مجالات كتير، زي:

• Computer Vision 👁️
• Recommendation Systems 🎯
• Finance 💰
• Genomics 🧬
• NLP & Embeddings 📝
• Exploratory Data Analysis 📊
━━━━━━━━━━━━━━
⚠️ بس خد بالك من نقطة مهمة جدًا!

الـPCA مش سحر. 😄
أكبر مشكلة فيها إنها ممكن تقلل Interpretability.

ليه؟

لأن الـPrincipal Components الجديدة مش Features أصلية.

كل Component عبارة عن Combination من الـOriginal Feature.

يعني ممكن الـModel يبقى أبسط أو أسرع، لكن في المقابل يكون أصعب في التفسير.
━━━━━━━━━━━━━━
🎯 إمتى PCA تكون اختيار كويس؟

خصوصًا لما:

✔️ يكون عندك Features كتير ومرتبطة ببعض
✔️ الحسابات والتدريب يكونوا مكلفين
✔️ محتاج تعمل Visualization في 2D أو 3D
✔️ عايز تقلل الـNoise أو الـRedundancy

💡 الخلاصة:

PCA مش مجرد طريقة لتقليل عدد الـFeatures...
هي طريقة لإعادة تمثيل الداتا في مساحة جديدة، بحيث نحتفظ بأكبر قدر ممكن من المعلومات الإحصائية المهمة، مع تقليل الـDimensions.

ولو بتتعامل مع High-Dimensional Data، فهم PCA يعتبر من الأساسيات المهمة جدًا في الـMachine Learning.

🚀 CNN vs. RNN vs. Transformer🔥 معركة عمالقة الذكاء الاصطناعيلو بتتعلم Machine Learning أو Deep Learning، أكيد قابلت الـ3...
20/08/2026

🚀 CNN vs. RNN vs. Transformer

🔥 معركة عمالقة الذكاء الاصطناعي

لو بتتعلم Machine Learning أو Deep Learning، أكيد قابلت الـ3 Architectures دول.

بس السؤال الأهم:

❓ ليه الـAI اتطور من CNNs لـ RNNs وبعدها Transformers؟

خلينا نفهم الحكاية بسرعة 👇
━━━━━━━━━━━━━━
🔹 CNN — Convolutional Neural Networks

الـCNN اتعملت أساسًا علشان تتعامل مع الصور.

يعني ممتازة في إنها تكتشف الـpatterns البصرية، زي:
✅ التعرف على الوجوه
✅ تحليل الصور الطبية
✅ Object Detection
✅ ومعظم تطبيقات Computer Vision

لكن لما الموضوع يبقى فيه Sequence وسياق بين العناصر، الـCNN بدأت تظهر حدودها.
━━━━━━━━━━━━━━
🔹 RNN — Recurrent Neural Networks

هنا ظهرت الـRNNs علشان تتعامل مع البيانات المتسلسلة، زي:

📝 Text
🎙️ Speech
📈 Time Series

الفكرة كانت بسيطة:

كل خطوة بتاخد في اعتبارها المعلومات اللي جات قبلها.
يعني النموذج بيحاول "يفتكر" اللي حصل قبل كده.
فكرة قوية جدًا... بس كان عندها مشاكل 👇

❌ صعوبة في الاحتفاظ بالمعلومات لفترات طويلة
❌ التدريب أبطأ بسبب المعالجة خطوة بخطوة
❌ الأداء ممكن يتراجع كل ما الـsequence تطول
━━━━━━━━━━━━━━
🔹 Transformer

وبعدين ظهر الـTransformer... وغيّر قواعد اللعبة. 🚀
بدل ما يعالج الـsequence واحدة واحدة، الـTransformer بيستخدم آلية اسمها:

🎯 Attention

والـAttention بتخلي النموذج يقدر يركز مباشرة على المعلومات الأكثر أهمية، حتى لو كانت بعيدة جدًا في الـsequence.
والنتيجة؟

✅ تدريب أسرع
✅ فهم أفضل للسياق
✅ قابلية هائلة للتوسع
✅ القدرة على التعامل مع sequences ضخمة

ومن هنا ظهرت نماذج زي:

• GPT
• BERT
• Claude
• Gemini

وهي النماذج اللي بتشغل جزء كبير من ثورة الـAI الحالية. 🤖
━━━━━━━━━━━━━━
🎯 الخلاصة

📸 CNN = ملكة الصور
📝 RNN = من رواد التعامل مع البيانات المتسلسلة
🧠 Transformer = الـArchitecture اللي غيرت شكل الـAI
من تحليل الصور، لمعالجة النصوص والـTime Series، كل Architecture ساعدت في حل مشاكل كانت موجودة في اللي قبلها، ودفعت المجال خطوة لقدام.

❓ بس السؤال هنا:

هل الـTransformers هتفضل مسيطرة على عالم الـAI خلال الـ10 سنين الجايين؟

ولا في Architecture جديدة بالفعل مستنية تاخد منها التاج؟ 👑

Address

Alexandria

Alerts

Be the first to know and let us send you an email when Ahmed Kamel - Data Analyst posts news and promotions. Your email address will not be used for any other purpose, and you can unsubscribe at any time.

Shortcuts

Share