GROUP BY的作用是先依据字段值进行归类,然后再执行聚合操作,在此过程中,所有非聚合列都必须全部写入GROUP BY;HA VING用于对分组后的结果进行过滤,WHERE则不能使用聚合函数;当进行多列分组时,需用逗号将各列分隔开,GROUP_CONCAT可用于合并组内的值,但它存在长度限制;WITH ROLLUP会使用NULL标记汇总行,对此需要进行显式处理。

GROUP BY 不是“先分组再统计”,而是“先按字段值归类,再对每组独立计算聚合结果”——理解这点,才能避开 80% 的报错和逻辑偏差。
GROUP BY 后面必须写全所有非聚合列
MySQL 严格模式下(默认开启),SELECT 中间出现的每个非聚合字段,都得出现在 GROUP BY 子句里。否则会直接报错:ERROR 1055 (42000): Expression #1 of SELECT list is not in GROUP BY clause。
- ✅ 正确写法:
SELECT department, COUNT(*) FROM employees GROUP BY department; - ❌ 错误写法:
SELECT department, name, COUNT(*) FROM employees GROUP BY department;(name没在GROUP BY中,且不是聚合列) - ⚠️ 注意:即使
name和department实际上是一对一关系(比如每个部门只有一人),MySQL 也不推断这种业务逻辑,仍会拒绝执行
HA VING 是唯一能过滤聚合结果的地方
WHERE 在分组前过滤行,HA VING 在分组后过滤组——这是最常混淆的点。想筛“平均工资 > 20000 的部门”,不能用 WHERE A VG(salary) > 20000,那会语法报错。
- ✅ 正确:
SELECT department, A VG(salary) AS a vg_sal FROM employees GROUP BY department HA VING A VG(salary) > 20000; - ❌ 错误:
SELECT department, A VG(salary) FROM employees WHERE A VG(salary) > 20000 GROUP BY department;(WHERE里不能用A VG) - ? 小技巧:如果
HA VING条件里要反复用聚合结果,可以给它起别名,但注意 MySQL 允许在HA VING中直接引用别名(如HA VING a vg_sal > 20000),而标准 SQL 不保证支持,建议优先写原表达式
多列分组和 GROUP_CONCAT 处理“组内多值”
单列分组容易理解;但真实场景中常需按多个维度组合分组(如部门+职位),或把组内多个值合并成一个字符串展示。
- 多列分组只需用逗号分隔:
SELECT department, position, COUNT(*) FROM employees GROUP BY department, position; - 想列出某用户所有订单产品:
SELECT user_id, GROUP_CONCAT(product_name SEPARATOR ', ') AS products FROM orders GROUP BY user_id; - ⚠️ 注意:
GROUP_CONCAT默认最大长度是 1024 字符,超长会被截断;可通过SET SESSION group_concat_max_len = 10000;临时调整 - 性能提示:
GROUP_CONCAT不走索引,大数据量时慎用于高频查询
WITH ROLLUP 要小心 NULL 分组标记
WITH ROLLUP 自动添加小计和总计行,但它用 NULL 表示汇总层级——这个 NULL 不是数据缺失,而是 MySQL 内部标记,容易被误判为脏数据。
- 示例:
SELECT department, position, SUM(salary) FROM employees GROUP BY department, position WITH ROLLUP; - 结果中会出现
(NULL, NULL, 总薪资)、(技术部, NULL, 技术部小计)这类行 - ? 如果后续要导出或对接前端,建议用
IFNULL(department, '总计')或CASE WHEN department IS NULL THEN '部门汇总' ELSE department END显式替换,避免业务代码把NULL当作空值处理 - ⚠️
WITH ROLLUP会让执行计划变复杂,大表慎用;替代方案可考虑应用层汇总或物化视图
实际上,真正具有挑战性的并非正确编写语法,而是准确判断“这一行究竟属于哪一组”。尤其是当分组字段包含 NULL,或者使用了表达式(例如 YEAR(hire_date))时,MySQL的分组行为会与我们的直觉存在一些细微的偏差。因此,在动手操作之前,先运用 SELECT * 加上 GROUP BY 来查看原始的分组结构,这要比盲目猜测安全得多。
