假设我在Xeon Phi寄存器中有以下4个双精度向量:
A-> |a8|a7|a6|a5|a4|a3|a2|a1|
B-> |b8|b7|b6|b5|b4|b3|b2|b1|
C-> |c8|c7|c6|c5|c4|c3|c2|c1|
D-> |d8|d7|d6|d5|d4|d3|d2|d1|
我想将它们置于以下内容中:
A_new ->|d2|d1|c2|c1|b2|b1|a2|a1|
B_new ->|d4|d3|c4|c3|b4|b3|a4|a3|
C_new ->|d6|d5|c6|c5|b6|b5|a6|a5|
D_new ->|d8|d7|c8|c7|b8|b7|a8|a7|
目标是得到:
O = _mm512_add_pd(_mm512_add_pd(A_new,B_new),_mm512_add_pd(C_new,D_new));
如何以最少的指令/周期完成上述操作?
1 回答
Evgueni Petrov在英特尔论坛上的回答:
在撰写本文时,英特尔C用户指南中未提及_mm512_mask_blend_pd()内在函数,但应尽快予以纠正 . 它出现在“zmmintrin.h”头文件中 .