在PostgreSQL中如何生成测试kmean算法的数据

1 minute read

背景

生成Kmeans的测试数据。

例如每10000为界，生成10个种子，每个节点以100内的随机数相加，生成一组测试数据。

postgres=# create table test(id int, rand int);  
CREATE TABLE  
  
postgres=# insert into test select id*10000,trunc(random()*100 + id*10000) from generate_series(1,10) t(id), generate_series(1,100000) t1(rand);  
INSERT 0 1000000  
  
postgres=# select id,count(*) from test group by id order by 1;  
   id   | count    
--------+--------  
  10000 | 100000  
  20000 | 100000  
  30000 | 100000  
  40000 | 100000  
  50000 | 100000  
  60000 | 100000  
  70000 | 100000  
  80000 | 100000  
  90000 | 100000  
 100000 | 100000  
(10 rows)  

直接使用kmeans分为10类，不设置种子的话，分得不是很准确。

postgres=# select k,id,count(*) from (select kmeans(array[rand], 10) over () k, id from test) t group by 1,2 order by 1,2;  
 k |   id   | count    
---+--------+--------  
|  10000 | 100000  
|  20000 | 100000  
|  30000 |  49707  
|  30000 |  50293  
|  40000 | 100000  
|  50000 | 100000  
|  60000 | 100000  
|  70000 | 100000  
|  80000 |  49871  
|  80000 |  50129  
|  90000 | 100000  
| 100000 | 100000  
(12 rows)  

使用正确的种子后，分类精准。

postgres=# select k,id,count(*) from (select kmeans(array[rand], 10, array[10000,20000,30000,40000,50000,60000,70000,80000,90000,100000]) over () k, id from test) t group by 1,2 order by 1,2;  
 k |   id   | count    
---+--------+--------  
|  10000 | 100000  
|  20000 | 100000  
|  30000 | 100000  
|  40000 | 100000  
|  50000 | 100000  
|  60000 | 100000  
|  70000 | 100000  
|  80000 | 100000  
|  90000 | 100000  
| 100000 | 100000  
(10 rows)  

参考

《K-Means 数据聚集算法》

http://pgxn.org/dist/kmeans/

digoal’s 大量PostgreSQL文章入口

Twitter Facebook Google+ LinkedIn

PostgreSQL(PPAS 兼容Oracle) 从零开始入门手册 - 珍藏版

17 minute read

背景云数据库PPAS版，是阿里云与EnterpriseDB公司(简称EDB)合作基于PostgreSQL高度兼容Oracle语法的数据库服务，为用户提供易于操作的迁移工具，兼容范围涵盖：PL/SQL、数据类型、高级函数、表分区等。用户可以直接在阿里云购买PPAS进行使用。如果在购买PPAS前，想试用一下...

PostgreSQL pipelinedb 流计算插件 - IoT应用 - 实时轨迹聚合

1 minute read

背景 IoT场景，车联网场景，共享单车场景，人的行为位点等，终端实时上报的是孤立的位点，我们需要将其补齐成轨迹。例如共享单车，下单，开锁，生成订单，骑行，关闭订单，关锁。这个过程有一个唯一的订单号，每次上报的位点会包含时间，订单号，位置。根据订单号，将点聚合为轨迹。使用pipelinedb插件，可以实...

Digoal.zhou

在PostgreSQL中如何生成测试kmean算法的数据

背景

参考

digoal’s 大量PostgreSQL文章入口

You May Also Enjoy

PostgreSQL(PPAS 兼容Oracle) 从零开始入门手册 - 珍藏版

PostgreSQL pipelinedb 流计算插件 - IoT应用 - 实时轨迹聚合

PostgreSQL plpgsql 存储过程、函数 - 状态、异常变量打印、异常捕获… - GET [STACKED] DIAGNOSTICS

PostgreSQL datediff 日期间隔（单位转换）兼容SQL用法