27/08/2026
POOLING: TẠI SAO CNN CÓ THỂ GIẢM KÍCH THƯỚC ẢNH MÀ VẪN GIỮ THÔNG TIN QUAN TRỌNG?
Một bức ảnh chụp bằng điện thoại ngày nay dễ dàng có tới hàng triệu điểm ảnh. Nếu một mạng nơ-ron phải giữ nguyên toàn bộ số điểm ảnh đó qua mọi lớp xử lý, số lượng phép tính sẽ tăng nhanh tới mức không phần cứng nào kham nổi. Nhưng nghịch lý là các mạng nơ-ron tích chập, CNN, vẫn nhận diện được chính xác một con mèo trong ảnh dù đã thu nhỏ dữ liệu đi rất nhiều lần trong quá trình xử lý. Vậy làm sao có thể vừa giảm bớt dữ liệu, vừa không đánh mất thông tin quan trọng nhất?
Câu trả lời nằm ở một lớp xử lý tưởng chừng đơn giản nhưng đóng vai trò then chốt trong kiến trúc CNN: pooling.
📌 1. SAU LỚP TÍCH CHẬP LÀ MỘT RỪNG CON SỐ CẦN ĐƯỢC RÚT GỌN
Trước khi tới lớp pooling, một ảnh đầu vào đã đi qua lớp tích chập, convolution, nơi hàng loạt bộ lọc nhỏ quét qua ảnh để phát hiện các đặc trưng như cạnh, góc, hay vùng màu tương phản. Kết quả của bước này không phải một bức ảnh nhỏ gọn hơn, mà thường là một tập hợp nhiều bản đồ đặc trưng, feature map, có kích thước gần tương đương ảnh gốc, thậm chí còn nhiều lớp chồng lên nhau hơn.
Nếu cứ giữ nguyên toàn bộ khối dữ liệu đồ sộ đó rồi đưa thẳng qua lớp tích chập tiếp theo, số phép tính sẽ phình to theo cấp số nhân qua từng lớp, chưa kể mô hình còn dễ bị chi phối quá mức bởi từng chi tiết vụn vặt, ví dụ một hạt nhiễu nhỏ trên ảnh, thay vì tập trung vào những đặc trưng lớn thật sự mang ý nghĩa. Đây chính là bài toán mà lớp pooling được sinh ra để giải quyết.
📌 2. GIỮ LẠI ĐIỀU QUAN TRỌNG NHẤT, BỎ BỚT PHẦN DƯ THỪA
Hãy hình dung việc đọc lướt một bài báo dài bằng cách chỉ đọc câu quan trọng nhất trong mỗi đoạn, thay vì đọc từng chữ một. Người đọc vẫn nắm được ý chính của toàn bài, dù đã bỏ qua phần lớn số chữ. Pooling hoạt động theo đúng tinh thần đó, nhưng áp dụng lên bản đồ đặc trưng thay vì văn bản.
Cách phổ biến nhất là max pooling: bản đồ đặc trưng được chia thành nhiều ô vuông nhỏ, thường là 2x2 điểm ảnh một ô, và tại mỗi ô, thuật toán chỉ giữ lại đúng một giá trị lớn nhất trong ô đó, bỏ hết ba giá trị còn lại. Lý do chọn giá trị lớn nhất chứ không phải một cách chọn ngẫu nhiên nào khác nằm ở chính bản chất của bản đồ đặc trưng: những giá trị lớn thường tương ứng với vị trí mà một đặc trưng nào đó, ví dụ một cạnh sắc hay một vùng tương phản mạnh, được kích hoạt rõ ràng nhất. Giữ lại giá trị lớn nhất trong mỗi ô, nghĩa là giữ lại đúng bằng chứng mạnh nhất cho thấy đặc trưng đó có xuất hiện trong vùng ảnh này hay không, còn những con số nhỏ hơn xung quanh phần lớn chỉ là nhiễu hoặc thông tin dư thừa.
Sau một lớp max pooling với ô 2x2, kích thước bản đồ đặc trưng giảm đi một nửa theo cả chiều rộng lẫn chiều cao, tức là giảm còn một phần tư về tổng số điểm dữ liệu, trong khi những đặc trưng quan trọng nhất vẫn được giữ nguyên vẹn.
📌 3. MỘT LỢI ÍCH PHỤ QUAN TRỌNG KHÔNG KÉM VIỆC GIẢM KÍCH THƯỚC
Pooling không chỉ giúp giảm số phép tính. Nó còn mang lại một tính chất gọi là bất biến dịch chuyển nhỏ, translation invariance ở mức cục bộ, nghĩa là mô hình vẫn nhận ra một đặc trưng ngay cả khi đặc trưng đó lệch đi vài điểm ảnh so với vị trí ban đầu.
Hãy hình dung một chiếc tai mèo nằm ở góc trên bên trái ảnh trong lượt huấn luyện, nhưng ở một tấm ảnh khác, chiếc tai mèo lại lệch sang phải vài điểm ảnh do góc chụp khác nhau. Nếu không có pooling, một sai lệch vị trí nhỏ như vậy có thể khiến mô hình phản ứng khác hẳn, vì các phép tính tích chập vốn rất nhạy với vị trí chính xác của từng điểm ảnh. Nhưng vì pooling chỉ giữ lại giá trị lớn nhất trong cả một vùng ô vuông, dù đặc trưng "tai mèo" nằm ở điểm nào bên trong ô đó, kết quả sau pooling vẫn gần như không đổi. Nhờ vậy, mô hình học được cách nhận diện đặc trưng dựa trên sự xuất hiện của nó trong một vùng, thay vì phụ thuộc cứng nhắc vào từng tọa độ điểm ảnh cụ thể, giúp CNN nhận diện tốt hơn nhiều trên những ảnh thực tế vốn không bao giờ được chụp ở đúng một góc, một vị trí cố định.
📌 4. GIẢM KÍCH THƯỚC ĐỂ MẠNG NHÌN ĐƯỢC BỨC TRANH LỚN HƠN
Một tác dụng nữa thường bị bỏ qua của pooling nằm ở cách nó ảnh hưởng tới vùng nhìn, receptive field, của các lớp phía sau. Ở những lớp đầu của CNN, mỗi điểm trong bản đồ đặc trưng chỉ "nhìn thấy" một vùng rất nhỏ của ảnh gốc, đủ để phát hiện các chi tiết nhỏ như cạnh hay góc. Sau khi qua một lớp pooling, kích thước bản đồ đặc trưng thu nhỏ lại, khiến mỗi điểm ở lớp tích chập tiếp theo, dù áp dụng cùng kích thước bộ lọc như trước, giờ đây tương ứng với một vùng lớn hơn hẳn trên ảnh gốc.
Nhờ cơ chế này, càng đi sâu vào các lớp phía sau của CNN, mạng càng nhìn được những đặc trưng ở quy mô lớn hơn và trừu tượng hơn, từ cạnh và góc ở các lớp đầu, tới hình dạng bộ phận như tai, mắt ở các lớp giữa, và cuối cùng là hình dạng tổng thể như "đây là một con mèo" ở các lớp cuối. Pooling chính là một trong những cơ chế giúp CNN xây dựng được sự phân cấp đặc trưng từ chi tiết nhỏ tới khái niệm lớn đó, mà không cần thiết kế thủ công.
📌 5. KHI MỘT PHÉP RÚT GỌN ĐƠN GIẢN TRỞ THÀNH NỀN TẢNG CỦA THỊ GIÁC MÁY TÍNH
Từ những mô hình nhận diện chữ viết tay đơn giản cho tới các hệ thống thị giác máy tính phức tạp trong xe tự lái hay chẩn đoán hình ảnh y tế, pooling vẫn là một lớp xử lý gần như không thể thiếu trong phần lớn kiến trúc CNN, đứng ngay sau mỗi vài lớp tích chập. Một thao tác tưởng chừng chỉ đơn giản là "giữ số lớn nhất, bỏ số còn lại" hóa ra lại giải quyết cùng lúc ba vấn đề lớn: giảm chi phí tính toán, tăng khả năng chịu đựng sai lệch vị trí nhỏ, và mở rộng dần vùng nhìn để mạng học được các đặc trưng ngày càng trừu tượng.
Đây là lý do pooling được đưa vào làm nội dung cốt lõi khi AI57 giảng dạy về kiến trúc CNN và thị giác máy tính. Học viên không chỉ học khái niệm max pooling trên lý thuyết, mà còn tự tay quan sát kích thước bản đồ đặc trưng thu nhỏ dần qua từng lớp trong một mô hình thị giác thật, để hiểu tận gốc vì sao một chiếc camera có thể nhận diện được vật thể trong ảnh mà không cần xử lý từng điểm ảnh một cách nặng nề suốt toàn bộ mạng.
Inbox ngay để được tư vấn lộ trình AI57 phù hợp nhất cho con!
—-
AI 57 – CHƯƠNG TRÌNH ƯƠM MẦM KỸ SƯ AI TRẺ
🎖️ Lộ trình 6 module từ nền tảng đến chuyên sâu.
🎖️ Phù hợp nhiều trình độ, phát triển tư duy và kỹ năng AI.
🎖️ Đồng hành cùng NIC và Đại học Bách khoa Hà Nội.
—
☎️ Hotline: 099 696 3399
🏢 Tòa nhà Hồng Lĩnh Education, Ngõ 1 Ngụy Như Kon Tum, Thanh Xuân, Hà Nội.