sql补集

发布时间: 2023-08-16 07:30:37

① 求sql语句，按一个关联字段查询表1在表2中没有的记录，表2是表1的子集，想把补集查出来，谢谢！

select t1.id from t1 right outer join t2 on t1.id=t2.id where t2.id=null

② sql数据库中把两个表中的差集数据插入到第3个表，怎么写

insert into table_3 (column_1,column_2,column_3) select column_1,column_2,column_3 from table_1 minus select column_1,column_2,column_3 from table_2;

要点就是保持字段一致。

③ 关于sql查询b表中存在，a表中不存在的数据

这实际上是求非交集（差集）问题，sql语句求差集相对于求交集的办法要少得多。

求差集方法中，使用not in关键字进行筛选在逻辑上最容易理解，很多人都会想到利用到它，数据量不大时还行，但是它有个重大缺陷，那就是在碰到大数据表的情况下其运行效率极低，有没有可被利用的索引效率都一样极差。我曾在利用大数据表的测试中，发现not in 语句常常要花费数小时才能返回结果，最夸张的例子耗时竟然超过一天！在返回结果前数据查询会处在"假死"状态，让人感觉是返回了空集似的，其实不是那样的，只是数据库引擎尚未完成运算而已。

在有可被利用的索引情况下，我们可以利用非存在not exists子句来筛选出两表之间的差集，其运行效率是非常高的。以题主的语句为例可改写如下:

原来使用not in筛选差集，大数据表效率极差:
SELECT ipdz FROM ipdz_b WHERE ipdz not in(select ipdz_d from zj_b);

而使用not exists筛选差集，大数据表有索引可利用时返回结果酒快多了:
select b.ipdz from ipdz_b b where not exists(
select 1 from zj_b a where a.ipdz_d=b.ipdz);

请留意不要踩not exists的坑！尽管它在有可被利用的索引时运行效率极高，但是如果没可利用的索引它会跟not in一样在遇到大数据表时, 运行运行效率也很糟！

在没有索引可被利用的情况下，建议利用左(右)联接出现的null值来求出差集，但是需要留意并小心处理因两表连接所导致的记录行变多问题。

下面是以题主的表结构为例的sql语句写法，其返回结果集的速度还是很不错的：

left join 筛选差集：
select b.ipdz from ipdz_b b left join zj_b a on
a.ipdz_d=b.ipdz where a.ipdz_d is null;

这里假设a表的ipdz_d是唯一的，如果非唯一需调整如下

select b.ipdz from ipdz_b b left join (
select distinct ipzd_d from zj_b) a on
a.ipdz_d=b.ipdz where a.ipdz_d is null;

总结：

小数据量not in随便用，此方法逻辑简单，语句易于编写;
大数据量在有可利用的索引情况下，建议首选 not exists(因为效率最高);
大数据量时，有没有可被利用的索引not in都要避免使用。而not exists 在没索引可利用时也应避免使用，此时建议使用左left join或右连接返回差集会有比较好的表现。

后两种方法在逻辑上不太好理解，还要处理因连接导致的记录行变多问题，语句编写相对麻烦。

④ SQL语句补集

update 补集 b set 电流 = (SELECT 电流 FROM(select 地区电流 from 全集 minus select 地区电流 from c差集 ) a WHERE b.地区= a.地区
写3个就行了，你先试下

阅读全文

sql补集

与sql补集相关的内容