Nội dung này phục vụ mục đích giáo dục, không phải lời khuyên đầu tư hoặc tín hiệu giao dịch.

Trả lời ngắn: Median, hay trung vị, là giá trị nằm giữa một tập dữ liệu sau khi sắp xếp. Nó chia dữ liệu thành hai nửa theo vị trí. Với số quan sát lẻ, lấy một điểm giữa; với số quan sát chẵn, lấy trung bình cộng của hai điểm giữa.

Đọc xong, bạn sẽ hiểu:

  • Vì sao phải sắp xếp dữ liệu trước khi tìm median.
  • Cách xử lý khác nhau khi số quan sát lẻ hoặc chẵn.
  • Vì sao median ít bị một ngoại lệ kéo hơn mean nhưng không phải lúc nào cũng tốt hơn.

Mean #11, mọi giá trị cùng góp vào tổng nên một con số 40 kéo mean từ 10 lên 15. Median đổi câu hỏi: thay vì hỏi “tổng chia đều ra sao”, nó hỏi “quan sát nào nằm ở giữa sau khi xếp thứ tự”.

1. Median là gì?

OpenStax định nghĩa median là số chia dữ liệu đã sắp xếp thành hai nửa: khoảng một nửa giá trị nhỏ hơn hoặc bằng median, một nửa lớn hơn hoặc bằng median.

Từ khóa quan trọng là vị trí. Median không quan tâm một giá trị cách điểm giữa bao xa nhiều như mean; nó quan tâm thứ tự từ nhỏ tới lớn.

Quy trình cơ bản:

  1. Xác định phạm vi và làm sạch dữ liệu.
  2. Sắp xếp tăng dần.
  3. Đếm số quan sát n.
  4. Tìm một hoặc hai vị trí giữa.
  5. Lấy giá trị tại vị trí đó.

Median thường ký hiệu là M. Vị trí mediangiá trị median là hai thứ khác nhau. Với năm quan sát, vị trí giữa là vị trí thứ 3; con số nằm ở vị trí thứ 3 mới là giá trị median.

Ví dụ, danh sách chưa sắp xếp:

12, 8, 10, 9, 11

Phần tử thứ ba của danh sách này là 10, nhưng đó chỉ là tình cờ. Phải sắp xếp:

8, 9, 10, 11, 12

Bây giờ vị trí thứ 3 là điểm giữa, nên median bằng 10.

Median không nhất thiết là giá trị đã xuất hiện. Khi n chẵn, ta lấy trung bình của hai giá trị giữa; kết quả có thể nằm giữa chúng.

2. Tính median với số quan sát lẻ và chẵn

Trường hợp n lẻ

Với:

8, 9, 10, 11, 12

n=5. Vị trí giữa:

(n+1) ÷ 2 = 3

Quan sát thứ 3 là 10, nên:

Median = 10

Biểu thức (n+1)/2 cho vị trí, không phải công thức thay mọi số vào để ra giá trị median. Bạn vẫn phải đọc con số tại vị trí đó.

Trường hợp n chẵn

Thêm 40:

8, 9, 10, 11, 12, 40

n=6, không có một quan sát duy nhất ở giữa. Hai vị trí giữa là 3 và 4, tương ứng 10 và 11:

Median = (10+11) ÷ 2 = 10,5

Hình 1 — Sắp xếp trước; n lẻ lấy một điểm giữa, n chẵn lấy trung bình hai điểm giữa.

Con số 10,5 không có trong danh sách nhưng vẫn là median hợp lệ. Nó nằm giữa hai quan sát trung tâm.

So với mean khi thêm ngoại lệ

Thước đo Trước khi thêm 40 Sau khi thêm 40 Mức đổi
Mean 10 15 +5
Median 10 10,5 +0,5

Hình 2 — Median dựa vào vị trí giữa nên ít nhạy với độ lớn của một ngoại lệ.

Nếu đổi 40 thành 400, thứ tự sáu quan sát vẫn giữ và hai vị trí giữa vẫn là 10, 11. Median vẫn 10,5, còn mean tăng mạnh hơn. Đây là tính ít nhạy trước độ lớn của một ngoại lệ.

Nhưng median không “miễn nhiễm”. Nếu nhiều quan sát thay đổi hoặc có thêm nhiều giá trị ở một phía, vị trí giữa có thể dịch đáng kể. Median chỉ ít phụ thuộc vào khoảng cách của các giá trị cực đoan, không bỏ qua cấu trúc dữ liệu.

OpenStax về độ lệch cho thấy trong phân phối lệch phải—phần lớn giá trị nằm về phía thấp nhưng một số giá trị lớn tạo đoạn kéo dài sang phải—mean thường lớn hơn median. Đoạn kéo dài đó gọi là đuôi phải và nó kéo mean mạnh hơn. Đây là dấu hiệu cần nhìn hình dạng phân phối, không phải luật đúng cho mọi tập rời rạc.

3. Năm lỗi và giới hạn cần chặn

Lỗi 1: lấy phần tử giữa trước khi sắp xếp. Thứ tự nhập file không quyết định median. Ngay cả khi các dòng được ghi theo thời gian, muốn tìm median bạn vẫn phải sắp xếp theo giá trị đang đo.

Lỗi 2: nhầm vị trí với giá trị. (n+1)/2=3 nghĩa là đọc quan sát thứ 3, không có nghĩa median bằng 3.

Lỗi 3: n chẵn chỉ chọn một bên. Với 10 và 11 ở giữa, median là 10,5, không tùy ý chọn 10 hoặc 11. Nếu phương pháp chuyên ngành dùng quy ước khác, phải nêu rõ.

Lỗi 4: bỏ qua ô thiếu hoặc dòng trùng. Chúng làm n và vị trí giữa đổi. Trước khi sắp xếp, phải xác định ô trống có nghĩa là thiếu dữ liệu hay giá trị 0.

Lỗi 5: gọi median là “đại diện hoàn hảo”. Median không cho biết khoảng cách giữa các giá trị. Hai tập sau cùng median 10:

  • 9, 9, 10, 11, 11;
  • -100, 0, 10, 1.000, 10.000.

Tâm theo vị trí giống nhau nhưng độ phân tán—mức các giá trị nằm gần hay xa nhau—và hình dạng hoàn toàn khác. Cần xem thêm biểu đồ và một thước đo đơn giản như khoảng biến thiên, tức giá trị lớn nhất trừ giá trị nhỏ nhất.

NIST khi bàn về thước đo vị trí lưu ý median thường phù hợp hơn mean khi đuôi dữ liệu có giá trị cực đoan. “Thường” không có nghĩa luôn. Với phân phối đối xứng, sạch và cần dùng toàn bộ độ lớn quan sát, mean có thể giàu thông tin hơn.

Median cũng không thay thế Mode #13. Median nói điểm giữa theo thứ tự; mode nói giá trị xuất hiện nhiều nhất. Một tập có thể có median nhưng không có mode duy nhất.

4. Checklist và bài tập Google Sheets 15 phút

Trước khi báo median:

  1. Phạm vi dữ liệu và đơn vị đã rõ chưa?
  2. Ô thiếu, dòng trùng và lỗi nhập đã được kiểm chưa?
  3. Dữ liệu đã sắp xếp đúng theo giá trị chưa?
  4. n là lẻ hay chẵn?
  5. Một hoặc hai vị trí giữa là vị trí nào?
  6. Giá trị tại các vị trí đó là bao nhiêu?
  7. Kết quả thủ công có khớp hàm bảng tính không?
  8. Đã xem ngoại lệ và độ phân tán chưa?

Hình 3 — Kiểm thứ tự, số quan sát, hai vị trí giữa và độ phân tán.

Dừng nếu ô trống chưa được định nghĩa, danh sách chưa sắp xếp hoặc đơn vị đang trộn. Đừng dùng median như ngưỡng mua/bán hay dự báo chỉ vì nó ít nhạy với một ngoại lệ.

a. Bắt đầu từ đâu?

Mở Google Sheets miễn phí. Nhập danh sách chưa sắp xếp 12, 8, 10, 9, 11 vào A2:A6.

  • Sắp xếp ở cột khác: =SORT(A2:A6).
  • Tính median: =MEDIAN(A2:A6).
  • Tính mean để đối chiếu: =AVERAGE(A2:A6).

Hai thước đo đều bằng 10. Sau đó thêm 40 vào A7. Median thành 10,5; mean thành 15. Đổi 40 thành 400 và quan sát median giữ 10,5 trong khi mean đổi.

b. Mẫu đối chiếu đã điền

Dữ liệu đã sắp xếp n Vị trí giữa Median
8, 9, 10, 11, 12 5 3 10
8, 9, 10, 11, 12, 40 6 3 và 4 10,5

Đây là dữ liệu giả để học cơ chế. Chưa dùng tiền thật, chưa xóa ngoại lệ và chưa chọn thước đo chỉ vì nó cho kết quả đẹp hơn.

5. Tổng kết và bài học tiếp theo

a. Năm ý chính

  • Median là điểm giữa của dữ liệu sau khi sắp xếp.
  • n lẻ lấy một giá trị giữa; n chẵn lấy trung bình hai giá trị giữa.
  • Vị trí median khác giá trị median.
  • Median ít bị độ lớn của một ngoại lệ kéo hơn mean, nhưng không miễn nhiễm mọi thay đổi.
  • Median không nói độ phân tán; phải đọc cùng hình dạng và thước đo khác.

b. Câu hỏi tự kiểm tra

  • Có thể lấy phần tử thứ ba của danh sách chưa sắp xếp làm median không?
  • Với sáu quan sát, median được tính từ vị trí nào?
  • Đổi ngoại lệ 40 thành 400 có làm median ví dụ đổi không?

c. Gợi ý đáp án

Xem gợi ý câu 1

Không. Phải sắp xếp theo giá trị trước khi xác định điểm giữa. → xem mục 1.

Xem gợi ý câu 2

Lấy hai vị trí giữa là 3 và 4 rồi tính trung bình hai giá trị đó. → xem mục 2.

Xem gợi ý câu 3

Không; hai giá trị giữa vẫn là 10 và 11 nên median vẫn 10,5. → xem mục 2.

d. Thuật ngữ cần nhớ

Thuật ngữ Giải thích ngắn
Median Giá trị giữa của dữ liệu đã sắp xếp.
Dữ liệu đã sắp xếp Các quan sát theo thứ tự từ nhỏ đến lớn.
Vị trí median Thứ hạng của điểm giữa trong danh sách.
Giá trị median Con số tại vị trí giữa hoặc trung bình hai điểm giữa.
n lẻ Số quan sát không chia hết cho hai.
n chẵn Số quan sát chia hết cho hai.
Nửa dưới Phần dữ liệu nằm dưới điểm giữa.
Nửa trên Phần dữ liệu nằm trên điểm giữa.
Ít nhạy Kết quả ít đổi trước độ lớn của một ngoại lệ.
Độ phân tán Mức các giá trị trải rộng quanh trung tâm.

e. Nguồn tham khảo

Bài trước: Mean #11. Bài tiếp theo: Mode #13, nơi ta tìm giá trị xuất hiện nhiều nhất và xử lý trường hợp không có hoặc có nhiều mode.

Nội dung này phục vụ mục đích giáo dục, không phải lời khuyên đầu tư hoặc tín hiệu giao dịch. Mọi thị trường và sản phẩm tài chính đều có rủi ro mất vốn.