SQL优化的52条实用经验

2023-06-04 0 833

无论是复试却是前述合作开发(后端),SQL 强化始终是绕不行的两个热门话题, 责任编辑会提及 52 条 SQL 句子操控性强化思路。

很多强化思路须要你有很大的 SQL 课堂教学就可以感受当中的规矩,总之你也能依照那些优化思路去课堂教学呵呵,这种更能增进认知和梦境。

01

对查阅展开强化,应尽量减少全表扫描器,具体来说应考量在 WHERE 及 ORDER BY 牵涉的罚以创建检索。

02

应尽量减少在 WHERE 从句中对表头展开 NULL 值推论,创建表时 NULL 是缺省,但绝大多数这时候如果采用 NOT NULL,或是采用两个特定的值,如 0,-1 做为缺省。

03

应尽量减少在 WHERE 从句中采用 != 或 <> 运算符。MySQL 多于对下列运算符才采用检索:<,<=,=,>,>=,BETWEEN,IN,和这类这时候的 LIKE。

04

应尽量减少在 WHERE 从句中采用 OR 来相连前提,不然将引致发动机舍弃采用检索而展开全表扫描器,能采用 UNION 分拆查阅:

select id from t where num=10 union all select id from t where num=20

05

IN 和 NOT IN 也要禁用,不然会引致全表扫描器。对已连续的值,会用 BETWEEN 就千万别用 IN:

select id from t where num between 1 and 3

06

上面的查阅也将导致全表扫描器:

select id from t where name like‘%abc%’

或是 select id from t where name like‘%abc’ 若要提高效率,能考量全文检索。

而 select id from t where name like‘abc%’ 才用到检索。

07

如果在 WHERE 从句中采用参数,也会引致全表扫描器。

08

应尽量减少在 WHERE 从句中对表头展开表达式操作,应尽量减少在 WHERE 从句中对表头展开函数操作。

09

很多这时候用 EXISTS 代替 IN 是两个好的选择:

select num from a where num in(select num from b)

用上面的句子替换:

select num from a where exists(select 1 from b where num=a.num)

10

检索固然能提高相应的 SELECT 的效率,但同时也降低了 INSERT 及 UPDATE 的效。

因为 INSERT 或 UPDATE 时有可能会重建检索,所以怎样建检索须要慎重考量,视具体情况而定。

两个表的检索数最好千万别超过 6 个,若太多则应考量一些不常采用到的罚以建的检索是否有必要。

11

应尽可能的避免更新 clustered 检索数据列, 因为 clustered 检索数据列的顺序就是表记录的物理存储顺序,一旦该列值改变将引致整个表记录的顺序的调整,会耗费相当大的资源。

若应用系统须要频繁更新 clustered 检索数据列,那么须要考量是否应将该检索建为 clustered 检索。

12

尽量采用数字型表头,若只含数值信息的表头尽量千万别设计为字符型,这会降低查阅和相连的操控性,并会增加存储开销。

13

尽可能的采用 varchar,nvarchar 代替 char,nchar。因为具体来说变长表头存储空间小,能节省存储空间,其次对查阅来说,在两个相对较小的表头内搜索效率显然要高些。

14

最好千万别采用返回所有:select from t ,用具体的表头列表代替 “*”,千万别返回用不到的任何表头。

15

尽量减少向客户端返回大数据量,若数据量过大,如果考量相应需求是否合理。

16

采用表的别名(Alias):当在 SQL 句子中相连多个表时,请采用表的别名并把别名前缀于每个 Column 上。

这种一来,就能减少解析的时间并减少那些由 Column 歧义引起的语法错误。

17

采用“临时表”暂存中间结果:简化 SQL 句子的重要方法就是采用临时表暂存中间结果。

但是临时表的好处远远不止那些,将临时结果暂存在临时表,后面的查阅就在 tempdb 中了,这能避免程序中多次扫描器主表,也大大减少了程序执行中“共享锁”阻塞“更新锁”,减少了阻塞,提高了并发操控性。

18

一些 SQL 查阅句子应加上 nolock,读、写是会相互阻塞的,为了提高并发操控性。

对一些查阅,能加上 nolock,这种读的这时候能允许写,但缺点是可能读到未提交的脏数据。

采用 nolock 有 3 条原则:

查阅的结果用于“插、删、改”的不能加 nolock。查阅的表属于频繁发生页分裂的,禁用 nolock 。采用临时表一样能保存“数据前影”,起到类似 Oracle 的 undo 表空间的功能,能采用临时表提高并发操控性的,千万别用 nolock。

19

常见的简化规则如下:千万别有超过 5 个以上的表相连(JOIN),考量采用临时表或表变量存放中间结果。

少用子查阅,视图嵌套千万别过深,一般视图嵌套千万别超过 2 个为宜。

20

将须要查阅的结果预先计算好放在表中,查询的这时候再 Select。这在 SQL 7.0 以前是最重要的手段,例如医院的住院费计算。

21

用 OR 的字句能分解成多个查阅,并且通过 UNION 相连多个查阅。

他们的速度只同是否采用检索有关,如果查阅须要用到联合检索,用 UNION all 执行的效率更高。

多个 OR 的字句没有用到检索,改写成 UNION 的形式再试图与检索匹配。两个关键的问题是否用到检索。

22

在 IN 后面值的列表中,将出现最频繁的值放在最前面,出现得最少的放在最后面,减少推论的次数。

23

尽量将数据的处理工作放在服务器上,减少网络的开销,如采用存储过程。

存储过程是编译好、强化过、并且被组织到两个执行规划里、且存储在数据库中的 SQL 句子,是控制流语言的集合,速度总之快。

反复执行的动态 SQL,能采用临时存储过程,该过程(临时表)被放在 Tempdb 中。

24

当服务器的内存够多时,配制线程数量=最大相连数+5,这种能发挥最大的效率;不然采用配制线程数量<最大相连数,启用 SQL SERVER 的线程池来解决,如果却是数量=最大相连数+5,严重的损害服务器的操控性。

25

查阅的关联同写的顺序:

select a.personMemberID, * from chineseresume a,personmember b where personMemberID = b.referenceid and a.personMemberID = ‘JCNPRH39681’ (A = B ,B = ‘号码’) select a.personMemberID, * from chineseresume a,personmember b where a.personMemberID = b.referenceid and a.personMemberID = ‘JCNPRH39681’ and b.referenceid = ‘JCNPRH39681’ (A = B ,B = ‘号码’, A = ‘号码’) select a.personMemberID, * from chineseresume a,personmember b where b.referenceid = ‘JCNPRH39681’ and a.personMemberID = ‘JCNPRH39681’ (B = ‘号码’, A = ‘号码’)

26

尽量采用 EXISTS 代替 select count(1) 来推论是否存在记录。count 函数多于在统计表中所有行数时采用,而且 count(1) 比 count(*) 更有效率。

27

尽量采用 “>=”,千万别采用 “>”。

28

检索的采用规范:

检索的创建要与应用结合考量,建议大的 OLTP 表千万别超过 6 个检索。尽可能的采用检索表头做为查阅前提,尤其是聚簇检索,必要时能通过 index index_name 来强制指定检索。避免对大表查阅时展开 table scan,必要时考量新建检索。在采用检索表头做为前提时,如果该检索是联合检索,那么必须使用到该检索中的第两个表头做为前提时就可以保证系统采用该检索,不然该检索将不会被采用。要注意检索的维护,周期性重建检索,重新编译存储过程。

29

下列 SQL 前提句子中的列都建有恰当的检索,但执行速度却非常慢:

SELECT * FROM record WHERE substrINg(card_no,1,4)=’5378’ (13秒) SELECT * FROM record WHERE amount/30< 1000 (11秒) SELECT * FROM record WHERE convert(char(10),date,112)=’19991201’ (10秒)

分析:WHERE 从句中对列的任何操作结果都是在 SQL 运行时逐列计算得到的,因此它不得不展开表搜索,而没有采用该罚以面的检索。

如果那些结果在查阅编译时就能得到,那么就能被 SQL 强化器强化,采用检索,避免表搜索,因此将 SQL 重写成上面这种:

SELECT * FROM record WHERE card_no like ‘5378%’ (< 1秒) SELECT * FROM record WHERE amount< 1000*30 (< 1秒) SELECT * FROM record WHERE date= ‘1999/12/01’ (< 1秒)

30

当有一批处理的插入或更新时,用批量插入或批量更新,绝不会一条条记录的去更新。

31

在所有的存储过程中,能够用 SQL 句子的,我绝不会用循环去实现。

例如:列出上个月的每一天,我会用 connect by 去递归查阅呵呵,绝不会去用循环从上个月第一天到最后一天。

32

选择最有效率的表名顺序(只在基于规则的强化器中有效):Oracle 的解析器按照从右到左的顺序处理 FROM 从句中的表名,FROM 从句中写在最后的表(基础表 driving table)将被最先处理。

在 FROM 从句中包含多个表的情况下,你必须选择记录条数最少的表做为基础表。

如果有 3 个以上的表相连查阅,那就须要选择交叉表(intersection table)做为基础表,交叉表是指那个被其他表所引用的表。

33

提高 GROUP BY 句子的效率,能通过将不须要的记录在 GROUP BY 之前过滤掉。上面两个查阅返回相同结果,但第二个明显就快了许多。

低效:

SELECT JOB , AVG(SAL) FROM EMP GROUP BY JOB HAVING JOB =’PRESIDENT’ OR JOB =’MANAGER’

高效:

SELECT JOB , AVG(SAL) FROM EMP WHERE JOB =’PRESIDENT’ OR JOB =’MANAGER’ GROUP BY JOB

34

SQL 句子用大写,因为 Oracle 总是先解析 SQL 句子,把小写的字母转换成大写的再执行。

35

别名的采用,别名是大型数据库的应用技巧,就是表名、列名在查阅中以两个字母为别名,查阅速度要比建相连表快 1.5 倍。

36

避免死锁,在你的存储过程和触发器中访问同两个表时总是以相同的顺序;事务应经可能地缩短,在两个事务中应尽可能减少牵涉到的数据量;永远千万别在事务中等待用户输入。

37

避免采用临时表,除非却有须要,不然应尽量减少采用临时表,相反,能采用表变量代替。

大多数这时候(99%),表变量驻扎在内存中,因此速度比临时表更快,临时表驻扎在 TempDb 数据库中,因此临时表上的操作须要跨数据库通信,速度自然慢。

38

最好千万别采用触发器:

触发两个触发器,执行两个触发器事件本身就是两个耗费资源的过程。如果能够采用约束实现的,尽量千万别采用触发器。千万别为不同的触发事件(Insert、Update 和 Delete)采用相同的触发器。千万别在触发器中采用事务型代码。

39

索引创建规则:

表的主键、外键必须有检索。数据量超过 300 的表如果有检索。经常与其他表展开相连的表,在相连表头上如果创建检索。经常出现在 WHERE 从句中的表头,特别是大表的表头,如果创建检索。检索如果建在选择性高的表头上。检索如果建在小表头上,对大的文本表头甚至超长表头,千万别建检索。复合检索的创建须要展开仔细分析,尽量考量用单表头检索代替。正确选择复合检索中的主列表头,一般是选择性较好的表头。复合检索的几个表头是否经常同时以 AND 方式出现在 WHERE 从句中?单表头查阅是否极少甚至没有?如果是,则能创建复合检索;不然考量单表头检索。如果复合检索中包含的表头经常单独出现在 WHERE 从句中,则分解为多个单表头检索。如果复合检索所包含的表头超过 3 个,那么仔细考量其必要性,考量减少复合的表头。如果既有单表头检索,又有这几个表头上的复合检索,一般能删除复合检索。频繁展开数据操作的表,千万别创建太多的检索。删除无用的检索,避免对执行计划造成负面影响。表上创建的每个检索都会增加存储开销,检索对插入、删除、更新操作也会增加处理上的开销。

另外,过多的复合检索,在有单表头检索的情况下,一般都是没有存在价值的;相反,还会降低数据增加删除时的操控性,特别是对频繁更新的表来说,负面影响更大。尽量千万别对数据库中某个含有大量重复的值的表头创建检索。

40

MySQL 查阅强化总结:采用慢查阅日志去发现慢查阅,采用执行计划去推论查阅是否正常运行,总是去测试你的查阅看看是否他们运行在最佳状态下。

久而久之操控性总会变化,避免在整个表上采用 count(*),它可能锁住整张表,使查阅保持一致以便后续相似的查阅能采用查阅缓存。

在适当的情形下采用 GROUP BY 而不是 DISTINCT,在 WHERE、GROUP BY 和 ORDER BY 从句中采用有检索的列,保持检索简单,不在多个检索中包含同两个列。

有这时候 MySQL 会采用错误的检索,对这种情况采用 USE INDEX,检查采用 SQL_MODE=STRICT 的问题,对记录数小于 5 的检索表头,在 UNION 的这时候采用 LIMIT 不是是用 OR。

为了避免在更新前 SELECT,采用 INSERT ON DUPLICATE KEY 或是 INSERT IGNORE;千万别用 UPDATE 去实现,千万别采用 MAX。

采用索引表头和 ORDER BY 从句 LIMIT M,N 前述上能减缓查阅在这类情况下,有节制地采用。

在 WHERE 从句中采用 UNION 代替子查阅,在重新启动的 MySQL,记得来温暖你的数据库,以确保数据在内存和查阅速度快,考量持久相连,而不是多个相连,以减少开销。

基准查阅,包括采用服务器上的负载,有时两个简单的查阅能影响其他查阅,当负载增加在服务器上,采用 SHOW PROCESSLIST 查看慢的和有问题的查阅,在合作开发环境中产生的镜像数据中测试的所有可疑的查阅。

41

MySQL 备份过程:

从二级复制服务器上展开备份。在展开备份期间停止复制,以避免在数据依赖和外键约束上出现不一致。彻底停止 MySQL,从数据库文件展开备份。如果采用 MySQL dump 展开备份,请同时备份二进制日志文件 – 确保复制没有中断。千万别信任 LVM 快照,这很可能产生数据不一致,将来会给你带来麻烦。为了更容易展开单表恢复,以表为单位导出数据——如果数据是与其他表隔离的。 当采用 mysqldump 时请采用–opt。在备份之前检查和强化表。为了更快的展开导入,在导入时临时禁用外键约束。为了更快的进行导入,在导入时临时禁用唯一性检测。在每一次备份后计算数据库,表和检索的尺寸,以便更够监控数据尺寸的增长。通过自动调度脚本监控复制实例的错误和延迟。定期执行备份。

42

查阅缓冲并不自动处理空格,因此,在写 SQL 句子时,应尽量减少空格的采用,尤其是在 SQL 首和尾的空格(因为查阅缓冲并不自动截取首尾空格)。

43

member 用 mid 做标准展开分表方便查阅么?一般的业务需求中基本上都是以 username 为查阅依据,正常应当是 username 做 hash 取模来分表。

而分表的话 MySQL 的 partition 功能就是干这个的,对代码是透明的;在代码层面去实现貌似是不合理的。

44

我们如果为数据库里的每张表都设置两个 ID 做为其主键,而且最好的是两个 INT 型的(推荐采用 UNSIGNED),并设置上自动增加的 AUTO_INCREMENT 标志。

45

在所有的存储过程和触发器的开始处设置 SET NOCOUNT ON,在结束时设置 SET NOCOUNT OFF。

无需在执行存储过程和触发器的每个句子后向客户端发送 DONE_IN_PROC 消息。

46

MySQL 查阅可以启用高速查阅缓存。这是提高数据库操控性的有效 MySQL 强化方法之一。

当同两个查阅被执行多次时,从缓存中提取数据和直接从数据库中返回数据快很多。

47

EXPLAIN SELECT 查阅用来跟踪查看效果:采用 EXPLAIN 关键字能让你知道 MySQL 是如何处理你的 SQL 句子的。

这能帮你分析你的查阅句子或是表结构的操控性瓶颈。EXPLAIN 的查阅结果还会告诉你你的检索主键被如何利用的,你的数据表是如何被搜索和排序的。

48

当只要一行数据时采用 LIMIT 1:当你查阅表的很多这时候,你已经知道结果只会有一条结果,但因为你可能须要去 fetch 游标,或是你也许会去检查返回的记录数。

在这种情况下,加上 LIMIT 1 能增加操控性。这种一来,MySQL 数据库发动机会在找到一条数据后停止搜索,而不是继续往后查少下一条符合记录的数据。

49

选择表合适存储发动机:

①myisam:应用时以读和插入操做为主,多于少量的更新和删除,并且对事务的完整性,并发性要求不是很高的。

②InnoDB:事务处理,和并发前提下要求数据的一致性。除了插入和查阅外,包括很多的更新和删除。(InnoDB 有效地降低删除和更新引致的锁定)。

对支持事务的 InnoDB 类型的表来说,影响速度的主要原因是 AUTOCOMMIT 默认设置是打开的,而且程序没有显式调用 BEGIN 开始事务,引致每插入一条都自动提交,严重影响了速度。

能在执行 SQL 前调用 begin,多条 SQL 形成两个事物(即使 autocommit 打开也能),将大大提高操控性。

50

强化表的数据类型,选择合适的数据类型:

原则:更小通常更好,简单就好,所有表头都得有缺省,尽量减少 NULL。

例如:数据库表设计这时候更小的占磁盘空间尽可能采用更小的整数类型。(mediumint 就比 int 更合适)

比如时间表头:datetime 和 timestamp。

datetime 占用8个字节,timestamp 占用 4 个字节,只用了一半。而 timestamp 表示的范围是 1970—2037 适合做更新时间。

MySQL 能很好的支持大数据量的存取,但是一般说来,数据库中的表越小,在它上面执行的查阅也就会越快。

因此,在创建表的这时候,为了获得更好的操控性,我们能将表中表头的宽度设得尽可能小。

例如:在定义邮政编码这个表头时,如果将其设置为 CHAR(255),显然给数据库增加了不必要的空间。

甚至采用 VARCHAR 这种类型也是多余的,因为 CHAR(6) 就能很好的完成任务了。

同样的,如果能的话,我们如果采用 MEDIUMINT 而不是 BIGIN 来定义整型表头,如果尽量把表头设置为 NOT NULL,这种在将来执行查阅的这时候,数据库不用去比较 NULL 值。

对这类文本表头,例如“省份”或是“性别”,我们能将它们定义为 ENUM 类型。

因为在 MySQL 中,ENUM 类型被当作值型数据来处理,而值型数据被处理起来的速度要比文本类型快得多。这种,我们又能提高数据库的操控性。

51

字符串数据类型:char,varchar,text 选择区别。

52

任何对列的操作都将引致表扫描器,它包括数据库函数、计算表达式等等,查阅时要尽可能将操作移至等号右边。

作者:SimpleWu

编辑:陶家龙

出处:http://cnblogs.com/SimpleWu/p/9929043.html

SQL优化的52条实用经验
SQL优化的52条实用经验

小千老师这里还提供海量学习资料包(教程+源码+学习笔记+工具+课件+复试题解析)免费领取,请用手机端知乎点击上方链接即可获得,还有大牛讲师在线答疑免费辅导!

相关文章

发表评论
暂无评论
官方客服团队

为您解决烦忧 - 24小时在线 专业服务