LLVM 24.0.0git
AMDGPURegBankLegalizeRules.cpp
Go to the documentation of this file.
1//===-- AMDGPURegBankLegalizeRules.cpp ------------------------------------===//
2//
3// Part of the LLVM Project, under the Apache License v2.0 with LLVM Exceptions.
4// See https://llvm.org/LICENSE.txt for license information.
5// SPDX-License-Identifier: Apache-2.0 WITH LLVM-exception
6//
7//===----------------------------------------------------------------------===//
8//
9/// Definitions of RegBankLegalize Rules for all opcodes.
10/// Implementation of container for all the Rules and search.
11/// Fast search for most common case when Rule.Predicate checks LLT and
12/// uniformity of register in operand 0.
13//
14//===----------------------------------------------------------------------===//
15
17#include "AMDGPUInstrInfo.h"
18#include "GCNSubtarget.h"
21#include "llvm/IR/IntrinsicsAMDGPU.h"
23
24#define DEBUG_TYPE "amdgpu-regbanklegalize"
25
26using namespace llvm;
27using namespace AMDGPU;
28
29bool AMDGPU::isAnyPtr(LLT Ty, unsigned Width) {
30 return Ty.isPointer() && Ty.getSizeInBits() == Width;
31}
32
34 std::initializer_list<RegBankLLTMappingApplyID> DstOpMappingList,
35 std::initializer_list<RegBankLLTMappingApplyID> SrcOpMappingList,
37 : DstOpMapping(DstOpMappingList), SrcOpMapping(SrcOpMappingList),
39
41 std::initializer_list<UniformityLLTOpPredicateID> OpList,
42 std::function<bool(const MachineInstr &)> TestFunc)
44
46 const MachineUniformityInfo &MUI,
47 const MachineRegisterInfo &MRI) {
48 switch (UniID) {
49 case S1:
50 return MRI.getType(Reg) == LLT::scalar(1);
51 case S16:
52 return MRI.getType(Reg) == LLT::scalar(16);
53 case S32:
54 return MRI.getType(Reg) == LLT::scalar(32);
55 case S64:
56 return MRI.getType(Reg) == LLT::scalar(64);
57 case S128:
58 return MRI.getType(Reg) == LLT::scalar(128);
59 case P0:
60 return MRI.getType(Reg) == LLT::pointer(0, 64);
61 case P1:
62 return MRI.getType(Reg) == LLT::pointer(1, 64);
63 case P2:
64 return MRI.getType(Reg) == LLT::pointer(2, 32);
65 case P3:
66 return MRI.getType(Reg) == LLT::pointer(3, 32);
67 case P4:
68 return MRI.getType(Reg) == LLT::pointer(4, 64);
69 case P5:
70 return MRI.getType(Reg) == LLT::pointer(5, 32);
71 case P8:
72 return MRI.getType(Reg) == LLT::pointer(8, 128);
73 case Ptr32:
74 return isAnyPtr(MRI.getType(Reg), 32);
75 case Ptr64:
76 return isAnyPtr(MRI.getType(Reg), 64);
77 case Ptr128:
78 return isAnyPtr(MRI.getType(Reg), 128);
79 case V2S16:
80 return MRI.getType(Reg) == LLT::fixed_vector(2, 16);
81 case V2S32:
82 return MRI.getType(Reg) == LLT::fixed_vector(2, 32);
83 case V3S32:
84 return MRI.getType(Reg) == LLT::fixed_vector(3, 32);
85 case V4S32:
86 return MRI.getType(Reg) == LLT::fixed_vector(4, 32);
87 case B32:
88 return MRI.getType(Reg).getSizeInBits() == 32;
89 case B64:
90 return MRI.getType(Reg).getSizeInBits() == 64;
91 case B96:
92 return MRI.getType(Reg).getSizeInBits() == 96;
93 case B128:
94 return MRI.getType(Reg).getSizeInBits() == 128;
95 case B160:
96 return MRI.getType(Reg).getSizeInBits() == 160;
97 case B256:
98 return MRI.getType(Reg).getSizeInBits() == 256;
99 case B512:
100 return MRI.getType(Reg).getSizeInBits() == 512;
101 case DivAnyTy:
102 return MUI.isDivergentAtDef(Reg);
103 case UniS1:
104 return MRI.getType(Reg) == LLT::scalar(1) && MUI.isUniformAtDef(Reg);
105 case UniS16:
106 return MRI.getType(Reg) == LLT::scalar(16) && MUI.isUniformAtDef(Reg);
107 case UniS32:
108 return MRI.getType(Reg) == LLT::scalar(32) && MUI.isUniformAtDef(Reg);
109 case UniS64:
110 return MRI.getType(Reg) == LLT::scalar(64) && MUI.isUniformAtDef(Reg);
111 case UniS128:
112 return MRI.getType(Reg) == LLT::scalar(128) && MUI.isUniformAtDef(Reg);
113 case UniBF16:
114 return MRI.getType(Reg).isBFloat16() && MUI.isUniformAtDef(Reg);
115 case UniP0:
116 return MRI.getType(Reg) == LLT::pointer(0, 64) && MUI.isUniformAtDef(Reg);
117 case UniP1:
118 return MRI.getType(Reg) == LLT::pointer(1, 64) && MUI.isUniformAtDef(Reg);
119 case UniP2:
120 return MRI.getType(Reg) == LLT::pointer(2, 32) && MUI.isUniformAtDef(Reg);
121 case UniP3:
122 return MRI.getType(Reg) == LLT::pointer(3, 32) && MUI.isUniformAtDef(Reg);
123 case UniP4:
124 return MRI.getType(Reg) == LLT::pointer(4, 64) && MUI.isUniformAtDef(Reg);
125 case UniP5:
126 return MRI.getType(Reg) == LLT::pointer(5, 32) && MUI.isUniformAtDef(Reg);
127 case UniP6:
128 return MRI.getType(Reg) == LLT::pointer(6, 32) && MUI.isUniformAtDef(Reg);
129 case UniP8:
130 return MRI.getType(Reg) == LLT::pointer(8, 128) && MUI.isUniformAtDef(Reg);
131 case UniPtr32:
132 return isAnyPtr(MRI.getType(Reg), 32) && MUI.isUniformAtDef(Reg);
133 case UniPtr64:
134 return isAnyPtr(MRI.getType(Reg), 64) && MUI.isUniformAtDef(Reg);
135 case UniPtr128:
136 return isAnyPtr(MRI.getType(Reg), 128) && MUI.isUniformAtDef(Reg);
137 case UniV2S16:
138 return MRI.getType(Reg) == LLT::fixed_vector(2, 16) &&
139 MUI.isUniformAtDef(Reg);
140 case UniV2S32:
141 return MRI.getType(Reg) == LLT::fixed_vector(2, 32) &&
142 MUI.isUniformAtDef(Reg);
143 case UniV3S32:
144 return MRI.getType(Reg) == LLT::fixed_vector(3, 32) &&
145 MUI.isUniformAtDef(Reg);
146 case UniV4S32:
147 return MRI.getType(Reg) == LLT::fixed_vector(4, 32) &&
148 MUI.isUniformAtDef(Reg);
149 case UniV6S32:
150 return MRI.getType(Reg) == LLT::fixed_vector(6, 32) &&
151 MUI.isUniformAtDef(Reg);
152 case UniV8S16:
153 return MRI.getType(Reg) == LLT::fixed_vector(8, 16) &&
154 MUI.isUniformAtDef(Reg);
155 case UniV8S32:
156 return MRI.getType(Reg) == LLT::fixed_vector(8, 32) &&
157 MUI.isUniformAtDef(Reg);
158 case UniV16S16:
159 return MRI.getType(Reg) == LLT::fixed_vector(16, 16) &&
160 MUI.isUniformAtDef(Reg);
161 case UniV16S32:
162 return MRI.getType(Reg) == LLT::fixed_vector(16, 32) &&
163 MUI.isUniformAtDef(Reg);
164 case UniV32S16:
165 return MRI.getType(Reg) == LLT::fixed_vector(32, 16) &&
166 MUI.isUniformAtDef(Reg);
167 case UniV32S32:
168 return MRI.getType(Reg) == LLT::fixed_vector(32, 32) &&
169 MUI.isUniformAtDef(Reg);
170 case UniV2S64:
171 return MRI.getType(Reg) == LLT::fixed_vector(2, 64) &&
172 MUI.isUniformAtDef(Reg);
173 case UniB32:
174 return MRI.getType(Reg).getSizeInBits() == 32 && MUI.isUniformAtDef(Reg);
175 case UniB64:
176 return MRI.getType(Reg).getSizeInBits() == 64 && MUI.isUniformAtDef(Reg);
177 case UniB96:
178 return MRI.getType(Reg).getSizeInBits() == 96 && MUI.isUniformAtDef(Reg);
179 case UniB128:
180 return MRI.getType(Reg).getSizeInBits() == 128 && MUI.isUniformAtDef(Reg);
181 case UniB160:
182 return MRI.getType(Reg).getSizeInBits() == 160 && MUI.isUniformAtDef(Reg);
183 case UniB256:
184 return MRI.getType(Reg).getSizeInBits() == 256 && MUI.isUniformAtDef(Reg);
185 case UniB512:
186 return MRI.getType(Reg).getSizeInBits() == 512 && MUI.isUniformAtDef(Reg);
187 case UniBRC: {
188 if (MUI.isDivergentAtDef(Reg))
189 return false;
190 // Check if there is SGPR register class of same size as the LLT.
191 const SIRegisterInfo *TRI =
192 static_cast<const SIRegisterInfo *>(MRI.getTargetRegisterInfo());
193 // There is no 16 bit SGPR register class. Extra size check is required
194 // since getSGPRClassForBitWidth returns SReg_32RegClass for Size 16.
195 unsigned LLTSize = MRI.getType(Reg).getSizeInBits();
196 return LLTSize >= 32 && TRI->getSGPRClassForBitWidth(LLTSize);
197 }
198 case DivS1:
199 return MRI.getType(Reg) == LLT::scalar(1) && MUI.isDivergentAtDef(Reg);
200 case DivS16:
201 return MRI.getType(Reg) == LLT::scalar(16) && MUI.isDivergentAtDef(Reg);
202 case DivS32:
203 return MRI.getType(Reg) == LLT::scalar(32) && MUI.isDivergentAtDef(Reg);
204 case DivS64:
205 return MRI.getType(Reg) == LLT::scalar(64) && MUI.isDivergentAtDef(Reg);
206 case DivS128:
207 return MRI.getType(Reg) == LLT::scalar(128) && MUI.isDivergentAtDef(Reg);
208 case DivP0:
209 return MRI.getType(Reg) == LLT::pointer(0, 64) && MUI.isDivergentAtDef(Reg);
210 case DivP1:
211 return MRI.getType(Reg) == LLT::pointer(1, 64) && MUI.isDivergentAtDef(Reg);
212 case DivP2:
213 return MRI.getType(Reg) == LLT::pointer(2, 32) && MUI.isDivergentAtDef(Reg);
214 case DivP3:
215 return MRI.getType(Reg) == LLT::pointer(3, 32) && MUI.isDivergentAtDef(Reg);
216 case DivP4:
217 return MRI.getType(Reg) == LLT::pointer(4, 64) && MUI.isDivergentAtDef(Reg);
218 case DivP5:
219 return MRI.getType(Reg) == LLT::pointer(5, 32) && MUI.isDivergentAtDef(Reg);
220 case DivPtr32:
221 return isAnyPtr(MRI.getType(Reg), 32) && MUI.isDivergentAtDef(Reg);
222 case DivPtr64:
223 return isAnyPtr(MRI.getType(Reg), 64) && MUI.isDivergentAtDef(Reg);
224 case DivPtr128:
225 return isAnyPtr(MRI.getType(Reg), 128) && MUI.isDivergentAtDef(Reg);
226 case DivV2S16:
227 return MRI.getType(Reg) == LLT::fixed_vector(2, 16) &&
229 case DivV2S32:
230 return MRI.getType(Reg) == LLT::fixed_vector(2, 32) &&
232 case DivV4S32:
233 return MRI.getType(Reg) == LLT::fixed_vector(4, 32) &&
235 case DivV2S64:
236 return MRI.getType(Reg) == LLT::fixed_vector(2, 64) &&
238 case DivV3S32:
239 return MRI.getType(Reg) == LLT::fixed_vector(3, 32) &&
241 case DivV4S16:
242 return MRI.getType(Reg) == LLT::fixed_vector(4, 16) &&
244 case DivV8S16:
245 return MRI.getType(Reg) == LLT::fixed_vector(8, 16) &&
247 case DivV8S32:
248 return MRI.getType(Reg) == LLT::fixed_vector(8, 32) &&
250 case DivV16S16:
251 return MRI.getType(Reg) == LLT::fixed_vector(16, 16) &&
253 case DivV16S32:
254 return MRI.getType(Reg) == LLT::fixed_vector(16, 32) &&
256 case DivV6S32:
257 return MRI.getType(Reg) == LLT::fixed_vector(6, 32) &&
259 case DivV32S16:
260 return MRI.getType(Reg) == LLT::fixed_vector(32, 16) &&
262 case DivV32S32:
263 return MRI.getType(Reg) == LLT::fixed_vector(32, 32) &&
265 case DivB32:
266 return MRI.getType(Reg).getSizeInBits() == 32 && MUI.isDivergentAtDef(Reg);
267 case DivB64:
268 return MRI.getType(Reg).getSizeInBits() == 64 && MUI.isDivergentAtDef(Reg);
269 case DivB96:
270 return MRI.getType(Reg).getSizeInBits() == 96 && MUI.isDivergentAtDef(Reg);
271 case DivB128:
272 return MRI.getType(Reg).getSizeInBits() == 128 && MUI.isDivergentAtDef(Reg);
273 case DivB160:
274 return MRI.getType(Reg).getSizeInBits() == 160 && MUI.isDivergentAtDef(Reg);
275 case DivB256:
276 return MRI.getType(Reg).getSizeInBits() == 256 && MUI.isDivergentAtDef(Reg);
277 case DivB512:
278 return MRI.getType(Reg).getSizeInBits() == 512 && MUI.isDivergentAtDef(Reg);
279 case DivBRC: {
280 if (MUI.isUniformAtDef(Reg))
281 return false;
282 // Check if there is VGPR register class of same size as the LLT.
283 const SIRegisterInfo *TRI =
284 static_cast<const SIRegisterInfo *>(MRI.getTargetRegisterInfo());
285 return TRI->getSGPRClassForBitWidth(MRI.getType(Reg).getSizeInBits());
286 }
287 case BRC: {
288 // Check if there is SGPR and VGPR register class of same size as the LLT.
289 const SIRegisterInfo *TRI =
290 static_cast<const SIRegisterInfo *>(MRI.getTargetRegisterInfo());
291 unsigned LLTSize = MRI.getType(Reg).getSizeInBits();
292 return LLTSize >= 32 && TRI->getSGPRClassForBitWidth(LLTSize) &&
293 TRI->getVGPRClassForBitWidth(LLTSize);
294 }
295 case _:
296 return true;
297 default:
298 llvm_unreachable("missing matchUniformityAndLLT");
299 }
300}
301
303 const MachineUniformityInfo &MUI,
304 const MachineRegisterInfo &MRI) const {
305 // Check LLT signature.
306 for (unsigned i = 0; i < OpUniformityAndTypes.size(); ++i) {
307 const MachineOperand &MO = MI.getOperand(i);
308 if (OpUniformityAndTypes[i] == _) {
309 assert((!MI.getOperand(i).isReg() ||
310 !MI.getOperand(i).getReg().isVirtual()) &&
311 "_ is for non-register and physical register operands only");
312 continue;
313 }
314
315 // Remaining IDs check registers.
316 if (!MO.isReg())
317 return false;
318
319 if (!matchUniformityAndLLT(MO.getReg(), OpUniformityAndTypes[i], MUI, MRI))
320 return false;
321 }
322
323 // More complex check.
324 if (TestFunc)
325 return TestFunc(MI);
326
327 return true;
328}
329
331
333 : FastTypes(FastTypes) {}
334
336 if (Ty == LLT::scalar(16))
337 return S16;
338 if (Ty == LLT::scalar(32))
339 return S32;
340 if (Ty == LLT::scalar(64))
341 return S64;
342 if (Ty == LLT::fixed_vector(2, 16))
343 return V2S16;
344 if (Ty == LLT::fixed_vector(2, 32))
345 return V2S32;
346 if (Ty == LLT::fixed_vector(3, 32))
347 return V3S32;
348 if (Ty == LLT::fixed_vector(4, 32))
349 return V4S32;
350 return _;
351}
352
354 if (Ty == LLT::scalar(32) || Ty == LLT::fixed_vector(2, 16) ||
355 isAnyPtr(Ty, 32))
356 return B32;
357 if (Ty == LLT::scalar(64) || Ty == LLT::fixed_vector(2, 32) ||
358 Ty == LLT::fixed_vector(4, 16) || isAnyPtr(Ty, 64))
359 return B64;
360 if (Ty == LLT::fixed_vector(3, 32))
361 return B96;
362 if (Ty == LLT::fixed_vector(4, 32) || Ty == LLT::fixed_vector(2, 64) ||
363 Ty == LLT::fixed_vector(8, 16) || isAnyPtr(Ty, 128))
364 return B128;
365 return _;
366}
367
368const RegBankLLTMapping *
370 const MachineRegisterInfo &MRI,
371 const MachineUniformityInfo &MUI) const {
372 // Search in "Fast Rules".
373 // Note: if fast rules are enabled, RegBankLLTMapping must be added in each
374 // slot that could "match fast Predicate". If not, InvalidMapping is
375 // returned which results in failure, does not search "Slow Rules".
376 if (FastTypes != NoFastRules) {
377 Register Reg = MI.getOperand(0).getReg();
378 int Slot;
379 if (FastTypes == StandardB)
380 Slot = getFastPredicateSlot(LLTToBId(MRI.getType(Reg)));
381 else
382 Slot = getFastPredicateSlot(LLTToId(MRI.getType(Reg)));
383
384 if (Slot != -1)
385 return MUI.isUniformAtDef(Reg) ? &Uni[Slot] : &Div[Slot];
386 }
387
388 // Slow search for more complex rules.
389 for (const RegBankLegalizeRule &Rule : Rules) {
390 if (Rule.Predicate.match(MI, MUI, MRI))
391 return &Rule.OperandMapping;
392 }
393
394 return nullptr;
395}
396
398 Rules.push_back(Rule);
399}
400
402 RegBankLLTMapping RuleApplyIDs) {
403 int Slot = getFastPredicateSlot(Ty);
404 assert(Slot != -1 && "Ty unsupported in this FastRulesTypes");
405 Div[Slot] = std::move(RuleApplyIDs);
406}
407
409 RegBankLLTMapping RuleApplyIDs) {
410 int Slot = getFastPredicateSlot(Ty);
411 assert(Slot != -1 && "Ty unsupported in this FastRulesTypes");
412 Uni[Slot] = std::move(RuleApplyIDs);
413}
414
415int SetOfRulesForOpcode::getFastPredicateSlot(
417 switch (FastTypes) {
418 case Standard: {
419 switch (Ty) {
420 case S32:
421 return 0;
422 case S16:
423 return 1;
424 case S64:
425 return 2;
426 case V2S16:
427 return 3;
428 default:
429 return -1;
430 }
431 }
432 case StandardB: {
433 switch (Ty) {
434 case B32:
435 return 0;
436 case B64:
437 return 1;
438 case B96:
439 return 2;
440 case B128:
441 return 3;
442 default:
443 return -1;
444 }
445 }
446 case Vector: {
447 switch (Ty) {
448 case S32:
449 return 0;
450 case V2S32:
451 return 1;
452 case V3S32:
453 return 2;
454 case V4S32:
455 return 3;
456 default:
457 return -1;
458 }
459 }
460 default:
461 return -1;
462 }
463}
464
465RegBankLegalizeRules::RuleSetInitializer
466RegBankLegalizeRules::addRulesForGOpcs(std::initializer_list<unsigned> OpcList,
467 FastRulesTypes FastTypes) {
468 return RuleSetInitializer(OpcList, GRulesAlias, GRules, FastTypes);
469}
470
471RegBankLegalizeRules::RuleSetInitializer
472RegBankLegalizeRules::addRulesForIOpcs(std::initializer_list<unsigned> OpcList,
473 FastRulesTypes FastTypes) {
474 return RuleSetInitializer(OpcList, IRulesAlias, IRules, FastTypes);
475}
476
479 unsigned Opc = MI.getOpcode();
480 if (Opc == AMDGPU::G_INTRINSIC || Opc == AMDGPU::G_INTRINSIC_CONVERGENT ||
481 Opc == AMDGPU::G_INTRINSIC_W_SIDE_EFFECTS ||
482 Opc == AMDGPU::G_INTRINSIC_CONVERGENT_W_SIDE_EFFECTS) {
483 unsigned IntrID = cast<GIntrinsic>(MI).getIntrinsicID();
484 auto IRAIt = IRulesAlias.find(IntrID);
485 if (IRAIt == IRulesAlias.end())
486 return nullptr;
487 return &IRules.at(IRAIt->second);
488 }
489
490 auto GRAIt = GRulesAlias.find(Opc);
491 if (GRAIt == GRulesAlias.end())
492 return nullptr;
493 return &GRules.at(GRAIt->second);
494}
495
496// Syntactic sugar wrapper for predicate lambda that enables '&&', '||' and '!'.
497class Predicate {
498private:
499 struct Elt {
500 // Save formula composed of Pred, '&&', '||' and '!' as a jump table.
501 // Sink ! to Pred. For example !((A && !B) || C) -> (!A || B) && !C
502 // Sequences of && and || will be represented by jumps, for example:
503 // (A && B && ... X) or (A && B && ... X) || Y
504 // A == true jump to B
505 // A == false jump to end or Y, result is A(false) or Y
506 // (A || B || ... X) or (A || B || ... X) && Y
507 // A == true jump to end or Y, result is A(true) or Y
508 // A == false jump to B
509 // Notice that when negating expression, we simply flip Neg on each Pred
510 // and swap TJumpOffset and FJumpOffset (&& becomes ||, || becomes &&).
511 std::function<bool(const MachineInstr &)> Pred;
512 bool Neg; // Neg of Pred is calculated before jump
513 unsigned TJumpOffset;
514 unsigned FJumpOffset;
515 };
516
517 SmallVector<Elt, 8> Expression;
518
519 Predicate(SmallVectorImpl<Elt> &&Expr) { Expression.swap(Expr); };
520
521public:
522 Predicate(std::function<bool(const MachineInstr &)> Pred) {
523 Expression.push_back({Pred, false, 1, 1});
524 };
525
526 bool operator()(const MachineInstr &MI) const {
527 unsigned Idx = 0;
528 unsigned ResultIdx = Expression.size();
529 bool Result;
530 do {
531 Result = Expression[Idx].Pred(MI);
532 Result = Expression[Idx].Neg ? !Result : Result;
533 if (Result) {
534 Idx += Expression[Idx].TJumpOffset;
535 } else {
536 Idx += Expression[Idx].FJumpOffset;
537 }
538 } while ((Idx != ResultIdx));
539
540 return Result;
541 };
542
543 Predicate operator!() const {
544 SmallVector<Elt, 8> NegExpression;
545 for (const Elt &ExprElt : Expression) {
546 NegExpression.push_back({ExprElt.Pred, !ExprElt.Neg, ExprElt.FJumpOffset,
547 ExprElt.TJumpOffset});
548 }
549 return Predicate(std::move(NegExpression));
550 };
551
552 Predicate operator&&(const Predicate &RHS) const {
553 SmallVector<Elt, 8> AndExpression = Expression;
554
555 unsigned RHSSize = RHS.Expression.size();
556 unsigned ResultIdx = Expression.size();
557 for (unsigned i = 0; i < ResultIdx; ++i) {
558 // LHS results in false, whole expression results in false.
559 if (i + AndExpression[i].FJumpOffset == ResultIdx)
560 AndExpression[i].FJumpOffset += RHSSize;
561 }
562
563 AndExpression.append(RHS.Expression);
564
565 return Predicate(std::move(AndExpression));
566 }
567
568 Predicate operator||(const Predicate &RHS) const {
569 SmallVector<Elt, 8> OrExpression = Expression;
570
571 unsigned RHSSize = RHS.Expression.size();
572 unsigned ResultIdx = Expression.size();
573 for (unsigned i = 0; i < ResultIdx; ++i) {
574 // LHS results in true, whole expression results in true.
575 if (i + OrExpression[i].TJumpOffset == ResultIdx)
576 OrExpression[i].TJumpOffset += RHSSize;
577 }
578
579 OrExpression.append(RHS.Expression);
580
581 return Predicate(std::move(OrExpression));
582 }
583};
584
585// Initialize rules
588 : ST(&_ST), MRI(&_MRI) {
589
590 addRulesForGOpcs({G_ADD, G_SUB}, Standard)
591 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32AExt, Sgpr32AExt}})
592 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
593 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
594 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
596 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
597 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr64}})
598 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
601
602 addRulesForGOpcs({G_UADDO, G_USUBO}, Standard)
603 .Uni(S32, {{Sgpr32, Sgpr32Trunc}, {Sgpr32, Sgpr32}})
604 .Div(S32, {{Vgpr32, Vcc}, {Vgpr32, Vgpr32}});
605
606 addRulesForGOpcs({G_UADDE, G_USUBE, G_SADDE, G_SSUBE}, Standard)
608 .Div(S32, {{Vgpr32, Vcc}, {Vgpr32, Vgpr32, Vcc}});
609
610 addRulesForGOpcs({G_UADDSAT, G_SADDSAT, G_USUBSAT, G_SSUBSAT}, Standard)
611 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}})
612 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
613 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}})
614 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
616 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}});
617
618 bool HasVecMulU64 = ST->hasVMulU64Inst();
619 addRulesForGOpcs({G_MUL}, Standard)
620 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
621 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
622 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
623 .Uni(S64, {{SgprB64}, {SgprB64, SgprB64}})
625 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
626 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32AExt, Sgpr32AExt}})
627 .Div(S64, {{VgprB64}, {VgprB64, VgprB64}}, HasVecMulU64)
628 .Div(S64, {{VgprB64}, {VgprB64, VgprB64}, SplitTo32Mul}, !HasVecMulU64);
629
630 bool hasMulHi = ST->hasScalarMulHiInsts();
631 addRulesForGOpcs({G_UMULH, G_SMULH}, Standard)
632 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
633 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasMulHi)
634 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasMulHi);
635
636 addRulesForGOpcs({G_AMDGPU_MAD_U64_U32}, Standard)
637 .Div(S64, {{Vgpr64, Vcc}, {Vgpr32, Vgpr32, Vgpr64}})
639
640 bool HasScalarSMulU64 = ST->hasScalarSMulU64();
641 addRulesForGOpcs({G_AMDGPU_S_MUL_U64_U32, G_AMDGPU_S_MUL_I64_I32}, Standard)
642 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr64}, UniMul64}, HasScalarSMulU64)
643 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}, DivSMulToMAD});
644
645 addRulesForGOpcs({G_XOR, G_OR, G_AND}, StandardB)
647 .Any({{DivS1}, {{Vcc}, {Vcc, Vcc}}})
648 .Any({{UniS16}, {{Sgpr16}, {Sgpr16, Sgpr16}}})
649 .Any({{DivS16}, {{Vgpr16}, {Vgpr16, Vgpr16}}})
650 .Uni(B32, {{SgprB32}, {SgprB32, SgprB32}})
651 .Div(B32, {{VgprB32}, {VgprB32, VgprB32}})
652 .Uni(B64, {{SgprB64}, {SgprB64, SgprB64}})
653 .Div(B64, {{VgprB64}, {VgprB64, VgprB64}, SplitTo32});
654
655 addRulesForGOpcs({G_SHL}, Standard)
656 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32AExt, Sgpr32ZExt}})
657 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
659 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
660 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
661 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32}})
662 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
663 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
664
665 addRulesForGOpcs({G_LSHR}, Standard)
666 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32ZExt, Sgpr32ZExt}})
667 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
669 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
670 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
671 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32}})
672 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
673 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
674
675 addRulesForGOpcs({G_ASHR}, Standard)
676 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32SExt, Sgpr32ZExt}})
677 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
679 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
680 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
681 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32}})
682 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
683 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
684
685 addRulesForGOpcs({G_FSHR}, Standard)
686 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
687 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
688
689 addRulesForGOpcs({G_BSWAP}, Standard)
690 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
691 .Div(S16, {{Vgpr16}, {Vgpr16}})
692 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
693 .Div(S32, {{Vgpr32}, {Vgpr32}})
694 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16}})
695 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}});
696
697 addRulesForGOpcs({G_AMDGPU_CVT_F32_UBYTE0, G_AMDGPU_CVT_F32_UBYTE1,
698 G_AMDGPU_CVT_F32_UBYTE2, G_AMDGPU_CVT_F32_UBYTE3,
699 G_AMDGPU_RCP_IFLAG},
700 Standard)
701 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
702 .Div(S32, {{Vgpr32}, {Vgpr32}});
703
704 addRulesForGOpcs({G_FRAME_INDEX}).Any({{UniP5, _}, {{SgprP5}, {None}}});
705
706 addRulesForGOpcs({G_UBFX, G_SBFX}, Standard)
707 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32, Sgpr32}, S_BFE})
708 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}})
709 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32, Sgpr32}, S_BFE})
710 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32, Vgpr32}, V_BFE});
711
712 addRulesForGOpcs({G_SMIN, G_SMAX}, Standard)
713 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32SExt, Sgpr32SExt}})
714 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
715 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
716 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
718 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
719 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
720 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}});
721
722 addRulesForGOpcs({G_UMIN, G_UMAX}, Standard)
723 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32ZExt, Sgpr32ZExt}})
724 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
725 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
726 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
728 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
729 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
730 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}});
731
732 addRulesForGOpcs({G_IMPLICIT_DEF})
733 .Any({{UniS1}, {{Sgpr32Trunc}, {}}})
734 .Any({{UniS16}, {{Sgpr16}, {}}})
735 .Any({{UniBRC}, {{SgprBRC}, {}}});
736
737 addRulesForGOpcs({G_CONSTANT}, Standard)
738 .Any({{UniS1, _}, {{Sgpr32Trunc}, {}, UniCstExt}})
739 .Uni(S16, {{Sgpr16}, {}})
740 .Uni(S32, {{Sgpr32}, {}})
741 .Uni(S64, {{Sgpr64}, {}})
742 .Any({{UniPtr32, _}, {{SgprPtr32}, {}}})
743 .Any({{UniPtr64, _}, {{SgprPtr64}, {}}});
744
745 addRulesForGOpcs({G_FCONSTANT}, Standard)
746 .Uni(S16, {{Sgpr16}, {}})
747 .Uni(S32, {{Sgpr32}, {}})
748 .Uni(S64, {{Sgpr64}, {}});
749
750 addRulesForGOpcs({G_FREEZE})
751 .Any({{UniS1}, {{Sgpr32Trunc}, {Sgpr32AExt}}})
752 .Any({{DivS1}, {{Vcc}, {Vcc}}})
753 .Any({{UniS16}, {{Sgpr16}, {Sgpr16}}})
754 .Any({{UniBRC}, {{SgprBRC}, {SgprBRC}}})
755 .Any({{DivBRC}, {{VgprBRC}, {VgprBRC}}});
756
757 addRulesForGOpcs({G_BITCAST})
758 .Any({{UniS16}, {{Sgpr16}, {Sgpr16}}})
759 .Any({{DivS16}, {{Vgpr16}, {Vgpr16}}})
760 .Any({{UniBRC}, {{SgprBRC}, {SgprBRC}}})
761 .Any({{DivBRC}, {{VgprBRC}, {VgprBRC}}});
762
763 addRulesForGOpcs({G_UNMERGE_VALUES})
764 .Any({{UniS16}, {{}, {}, UnmergeToShiftTrunc}})
765 .Any({{UniBRC}, {{}, {}, VerifyAllSgpr}})
766 .Any({{DivBRC}, {{}, {}, ApplyAllVgpr}});
767
768 addRulesForGOpcs({G_BUILD_VECTOR, G_MERGE_VALUES})
769 .Any({{UniBRC, S16}, {{}, {}, VerifyAllSgpr}})
770 .Any({{UniBRC, BRC}, {{}, {}, VerifyAllSgpr}})
771 .Any({{DivBRC, S16}, {{}, {}, ApplyAllVgpr}})
772 .Any({{DivBRC, BRC}, {{}, {}, ApplyAllVgpr}});
773
774 addRulesForGOpcs({G_CONCAT_VECTORS})
775 .Any({{UniBRC, BRC}, {{}, {}, VerifyAllSgpr}})
776 .Any({{DivBRC, BRC}, {{}, {}, ApplyAllVgpr}});
777
778 addRulesForGOpcs({G_PHI})
779 .Any({{UniS1}, {{}, {}, AextToS32InIncomingBlockGPHI}})
780 .Any({{UniS16}, {{}, {}, VerifyAllSgprGPHI}})
781 .Any({{UniBRC}, {{}, {}, VerifyAllSgprGPHI}})
782 .Any({{DivBRC}, {{}, {}, VerifyAllSgprOrVgprGPHI}});
783
784 addRulesForGOpcs({G_EXTRACT_VECTOR_ELT})
785 .Any({{UniB32, UniBRC, UniS32}, {{SgprB32}, {SgprBRC, Sgpr32}}})
786 .Any({{DivB32, DivBRC, UniS32}, {{VgprB32}, {VgprBRC, Sgpr32}}})
787 .Any({{DivB32, BRC, DivS32},
789 .Any({{UniB64, UniBRC, UniS32}, {{SgprB64}, {SgprBRC, Sgpr32}}})
790 .Any({{DivB64, DivBRC, UniS32},
792 .Any({{DivB64, BRC, DivS32},
794
795 addRulesForGOpcs({G_INSERT_VECTOR_ELT})
797 {{SgprBRC}, {SgprBRC, SgprB32, Sgpr32}}})
798 .Any(
799 {{DivBRC, BRC, B32, UniS32}, {{VgprBRC}, {VgprBRC, VgprB32, Sgpr32}}})
800 .Any({{DivBRC, BRC, B32, DivS32},
804 .Any({{DivBRC, BRC, B64, UniS32},
806 .Any({{DivBRC, BRC, B64, DivS32},
808
809 // INTERSECT_RAY {Div}, {{VgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
810 // INTERSECT_RAY {Uni}, {{UniInVgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
811 addRulesForGOpcs({G_AMDGPU_BVH_INTERSECT_RAY, G_AMDGPU_BVH_DUAL_INTERSECT_RAY,
812 G_AMDGPU_BVH8_INTERSECT_RAY})
813 .Any({{}, {{}, {}, ApplyBVH_INTERSECT_RAY}});
814
815 // LOAD {Div}, {{VgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
816 // LOAD {Uni}, {{UniInVgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
817 // LOAD_NORET {}, {{}, {Imm, VgprSrc, ..., Sgpr_WF_RsrcIdx}}
818 // STORE {}, {{}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
819 addRulesForGOpcs({G_AMDGPU_INTRIN_IMAGE_LOAD, G_AMDGPU_INTRIN_IMAGE_LOAD_D16,
820 G_AMDGPU_INTRIN_IMAGE_LOAD_NORET,
821 G_AMDGPU_INTRIN_IMAGE_STORE,
822 G_AMDGPU_INTRIN_IMAGE_STORE_D16})
823 .Any({{}, {{}, {}, ApplyINTRIN_IMAGE}});
824
825 Predicate isSignedICmp([](const MachineInstr &MI) -> bool {
826 auto Pred =
827 static_cast<CmpInst::Predicate>(MI.getOperand(1).getPredicate());
828 return CmpInst::isSigned(Pred);
829 });
830
831 Predicate isEqualityICmp([](const MachineInstr &MI) -> bool {
832 auto Pred =
833 static_cast<CmpInst::Predicate>(MI.getOperand(1).getPredicate());
834 return ICmpInst::isEquality(Pred);
835 });
836
837 bool HasScalarCompareEq64 = ST->hasScalarCompareEq64();
838 // clang-format off
839 addRulesForGOpcs({G_ICMP})
840 .Any({{{UniS1, _, S16}, isEqualityICmp}, {{Sgpr32Trunc}, {None, Sgpr32ZExt, Sgpr32ZExt}}})
841 .Any({{{UniS1, _, S16}, !isEqualityICmp && isSignedICmp}, {{Sgpr32Trunc}, {None, Sgpr32SExt, Sgpr32SExt}}})
842 .Any({{{UniS1, _, S16}, !isEqualityICmp && !isSignedICmp}, {{Sgpr32Trunc}, {None, Sgpr32ZExt, Sgpr32ZExt}}})
843 .Any({{{DivS1, _, S16}}, {{Vcc}, {None, Vgpr16, Vgpr16}}})
844 .Any({{{UniS1, _, S32}}, {{Sgpr32Trunc}, {None, Sgpr32, Sgpr32}}})
845 .Any({{{DivS1, _, S32}}, {{Vcc}, {None, Vgpr32, Vgpr32}}})
846 .Any({{{UniS1, _, S64}, isEqualityICmp}, {{Sgpr32Trunc}, {None, Sgpr64, Sgpr64}}}, HasScalarCompareEq64)
847 .Any({{{UniS1, _, S64}, isEqualityICmp}, {{UniInVcc}, {None, Vgpr64, Vgpr64}}}, !HasScalarCompareEq64)
848 .Any({{{UniS1, _, S64}, !isEqualityICmp}, {{UniInVcc}, {None, Vgpr64, Vgpr64}}})
849 .Any({{{DivS1, _, S64}}, {{Vcc}, {None, Vgpr64, Vgpr64}}})
850 .Any({{{UniS1, _, Ptr32}}, {{Sgpr32Trunc}, {None, SgprPtr32, SgprPtr32}}})
851 .Any({{{DivS1, _, Ptr32}}, {{Vcc}, {None, VgprPtr32, VgprPtr32}}})
852 .Any({{{UniS1, _, Ptr64}, isEqualityICmp}, {{Sgpr32Trunc}, {None, SgprPtr64, SgprPtr64}}}, HasScalarCompareEq64)
853 .Any({{{UniS1, _, Ptr64}, isEqualityICmp}, {{UniInVcc}, {None, VgprPtr64, VgprPtr64}}}, !HasScalarCompareEq64)
854 .Any({{{UniS1, _, Ptr64}, !isEqualityICmp}, {{UniInVcc}, {None, VgprPtr64, VgprPtr64}}})
855 .Any({{{DivS1, _, Ptr64}}, {{Vcc}, {None, VgprPtr64, VgprPtr64}}});
856 // clang-format on
857
858 addRulesForGOpcs({G_BRCOND})
859 .Any({{UniS1}, {{}, {Sgpr32AExtBoolInReg}}})
860 .Any({{DivS1}, {{}, {Vcc}}});
861
862 addRulesForGOpcs({G_BR}).Any({{_}, {{}, {None}}});
863
864 addRulesForGOpcs({G_SELECT}, StandardB)
865 .Any({{DivS16}, {{Vgpr16}, {Vcc, Vgpr16, Vgpr16}}})
867 .Div(B32, {{VgprB32}, {Vcc, VgprB32, VgprB32}})
871
872 addRulesForGOpcs({G_ANYEXT})
873 .Any({{UniS16, S1}, {{None}, {None}}}) // should be combined away
874 .Any({{UniS32, S1}, {{None}, {None}}}) // should be combined away
875 .Any({{UniS64, S1}, {{None}, {None}}}) // should be combined away
876 .Any({{DivS16, S1}, {{Vgpr16}, {Vcc}, VccExtToSel}})
877 .Any({{DivS32, S1}, {{Vgpr32}, {Vcc}, VccExtToSel}})
878 .Any({{DivS64, S1}, {{Vgpr64}, {Vcc}, VccExtToSel}})
879 .Any({{UniS64, S32}, {{Sgpr64}, {Sgpr32}, Ext32To64}})
880 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}, Ext32To64}})
881 .Any({{UniS64, S16}, {{Sgpr64}, {Sgpr32AExt}, Ext32To64}})
882 .Any({{DivS64, S16}, {{Vgpr64}, {Vgpr32AExt}, Ext32To64}})
883 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}})
884 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}});
885
886 bool Has16bitCmp = ST->has16BitInsts();
887
888 // In global-isel G_TRUNC in-reg is treated as no-op, inst selected into COPY.
889 // It is up to user to deal with truncated bits.
890 // S1, S16, S32 and S64 results are handled with specific rules. Remaining
891 // (result, source) pairs with valid register classes are covered by the
892 // generic UniBRC/DivBRC wildcard rules.
893 addRulesForGOpcs({G_TRUNC})
894 .Any({{UniS1, UniS16}, {{None}, {None}}}) // should be combined away
895 .Any({{UniS1, UniS32}, {{None}, {None}}}) // should be combined away
896 .Any({{UniS1, UniS64}, {{None}, {None}}}) // should be combined away
897 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}})
898 .Any({{UniBRC, UniBRC}, {{SgprBRC}, {SgprBRC}}})
899 .Any({{DivBRC, DivBRC}, {{VgprBRC}, {VgprBRC}}})
900 .Any({{UniV2S16, V2S32}, {{SgprV2S16}, {SgprV2S32}}})
901 .Any({{DivV2S16, V2S32}, {{VgprV2S16}, {VgprV2S32}}})
902 // This is non-trivial. VgprToVccCopy is done using compare instruction.
903 .Any({{DivS1, DivS16}, {{Vcc}, {Vgpr16}, VgprToVccCopy}}, Has16bitCmp)
905 !Has16bitCmp)
906 .Any({{DivS1, DivS32}, {{Vcc}, {Vgpr32}, VgprToVccCopy}})
907 .Any({{DivS1, DivS64}, {{Vcc}, {Vgpr64}, VgprToVccCopy}});
908
909 addRulesForGOpcs({G_ZEXT})
913 .Any({{DivS16, S1}, {{Vgpr16}, {Vcc}, VccExtToSel}})
914 .Any({{DivS32, S1}, {{Vgpr32}, {Vcc}, VccExtToSel}})
915 .Any({{DivS64, S1}, {{Vgpr64}, {Vcc}, VccExtToSel}})
916 .Any({{UniS64, S32}, {{Sgpr64}, {Sgpr32}, Ext32To64}})
917 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}, Ext32To64}})
918 // not extending S16 to S32 is questionable.
919 .Any({{UniS64, S16}, {{Sgpr64}, {Sgpr32ZExt}, Ext32To64}})
920 .Any({{DivS64, S16}, {{Vgpr64}, {Vgpr32ZExt}, Ext32To64}})
921 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}})
922 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}});
923
924 addRulesForGOpcs({G_SEXT})
928 .Any({{DivS16, S1}, {{Vgpr16}, {Vcc}, VccExtToSel}})
929 .Any({{DivS32, S1}, {{Vgpr32}, {Vcc}, VccExtToSel}})
930 .Any({{DivS64, S1}, {{Vgpr64}, {Vcc}, VccExtToSel}})
931 .Any({{UniS64, S32}, {{Sgpr64}, {Sgpr32}, Ext32To64}})
932 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}, Ext32To64}})
933 // not extending S16 to S32 is questionable.
934 .Any({{UniS64, S16}, {{Sgpr64}, {Sgpr32SExt}, Ext32To64}})
935 .Any({{DivS64, S16}, {{Vgpr64}, {Vgpr32SExt}, Ext32To64}})
936 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}})
937 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}});
938
939 addRulesForGOpcs({G_SEXT_INREG})
940 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}})
941 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
942 .Any({{UniS64, S64}, {{Sgpr64}, {Sgpr64}}})
944
945 addRulesForGOpcs({G_ASSERT_ZEXT, G_ASSERT_SEXT}, Standard)
946 .Uni(S32, {{Sgpr32}, {Sgpr32, Imm}})
947 .Div(S32, {{Vgpr32}, {Vgpr32, Imm}})
948 .Uni(S64, {{Sgpr64}, {Sgpr64, Imm}})
949 .Div(S64, {{Vgpr64}, {Vgpr64, Imm}});
950
951 addRulesForGOpcs({G_ASSERT_ALIGN}, Standard)
952 .Uni(S32, {{Sgpr32}, {Sgpr32}})
953 .Div(S32, {{Vgpr32}, {Vgpr32}})
954 .Uni(S64, {{Sgpr64}, {Sgpr64}})
955 .Div(S64, {{Vgpr64}, {Vgpr64}})
956 .Any({{UniPtr32}, {{SgprPtr32}, {SgprPtr32}}})
957 .Any({{DivPtr32}, {{VgprPtr32}, {VgprPtr32}}})
958 .Any({{UniPtr64}, {{SgprPtr64}, {SgprPtr64}}})
959 .Any({{DivPtr64}, {{VgprPtr64}, {VgprPtr64}}});
960
961 // Atomic read-modify-write operations: result and value are always VGPR,
962 // pointer varies by address space.
963 addRulesForGOpcs({G_ATOMICRMW_ADD, G_ATOMICRMW_SUB, G_ATOMICRMW_XCHG,
964 G_ATOMICRMW_AND, G_ATOMICRMW_OR, G_ATOMICRMW_XOR,
965 G_ATOMICRMW_MIN, G_ATOMICRMW_MAX, G_ATOMICRMW_UMIN,
966 G_ATOMICRMW_UMAX, G_ATOMICRMW_UINC_WRAP,
967 G_ATOMICRMW_UDEC_WRAP, G_ATOMICRMW_FMIN, G_ATOMICRMW_FMAX})
968 .Any({{DivS32, P0, S32}, {{Vgpr32}, {VgprP0, Vgpr32}}})
969 .Any({{DivS64, P0, S64}, {{Vgpr64}, {VgprP0, Vgpr64}}})
970 .Any({{DivS32, P1, S32}, {{Vgpr32}, {VgprP1, Vgpr32}}})
971 .Any({{DivS64, P1, S64}, {{Vgpr64}, {VgprP1, Vgpr64}}})
972 .Any({{DivS32, P3, S32}, {{Vgpr32}, {VgprP3, Vgpr32}}})
973 .Any({{DivS64, P3, S64}, {{Vgpr64}, {VgprP3, Vgpr64}}});
974
975 addRulesForGOpcs({G_ATOMICRMW_USUB_SAT, G_ATOMICRMW_USUB_COND})
976 .Any({{DivS32, P0}, {{Vgpr32}, {VgprP0, Vgpr32}}})
977 .Any({{DivS32, P1}, {{Vgpr32}, {VgprP1, Vgpr32}}})
978 .Any({{DivS32, P3}, {{Vgpr32}, {VgprP3, Vgpr32}}});
979
980 bool HasAtomicFlatPkAdd16Insts = ST->hasAtomicFlatPkAdd16Insts();
981 bool HasAtomicBufferGlobalPkAddF16Insts =
982 ST->hasAtomicBufferGlobalPkAddF16NoRtnInsts() ||
983 ST->hasAtomicBufferGlobalPkAddF16Insts();
984 bool HasAtomicDsPkAdd16Insts = ST->hasAtomicDsPkAdd16Insts();
985 addRulesForGOpcs({G_ATOMICRMW_FADD})
986 .Any({{DivS32, P0, S32}, {{Vgpr32}, {VgprP0, Vgpr32}}})
987 .Any({{DivS64, P0, S64}, {{Vgpr64}, {VgprP0, Vgpr64}}})
988 .Any({{DivS32, P1, S32}, {{Vgpr32}, {VgprP1, Vgpr32}}})
989 .Any({{DivS64, P1, S64}, {{Vgpr64}, {VgprP1, Vgpr64}}})
990 .Any({{DivS32, P3, S32}, {{Vgpr32}, {VgprP3, Vgpr32}}})
991 .Any({{DivS64, P3, S64}, {{Vgpr64}, {VgprP3, Vgpr64}}})
992 .Any({{DivV2S16, P0, V2S16}, {{VgprV2S16}, {VgprP0, VgprV2S16}}},
993 HasAtomicFlatPkAdd16Insts)
994 .Any({{DivV2S16, P1, V2S16}, {{VgprV2S16}, {VgprP1, VgprV2S16}}},
995 HasAtomicBufferGlobalPkAddF16Insts)
996 .Any({{DivV2S16, P3, V2S16}, {{VgprV2S16}, {VgprP3, VgprV2S16}}},
997 HasAtomicDsPkAdd16Insts);
998
999 addRulesForGOpcs({G_ATOMIC_CMPXCHG})
1000 .Any({{DivS32, P2}, {{Vgpr32}, {VgprP2, Vgpr32, Vgpr32}}})
1001 .Any({{DivS64, P2}, {{Vgpr64}, {VgprP2, Vgpr64, Vgpr64}}})
1002 .Any({{DivS32, P3}, {{Vgpr32}, {VgprP3, Vgpr32, Vgpr32}}})
1003 .Any({{DivS64, P3}, {{Vgpr64}, {VgprP3, Vgpr64, Vgpr64}}});
1004
1005 addRulesForGOpcs({G_AMDGPU_ATOMIC_CMPXCHG})
1006 .Any({{DivS32, P0}, {{Vgpr32}, {VgprP0, VgprV2S32}}})
1007 .Any({{DivS32, P1}, {{Vgpr32}, {VgprP1, VgprV2S32}}})
1008 .Any({{DivS64, P0}, {{Vgpr64}, {VgprP0, VgprV2S64}}})
1009 .Any({{DivS64, P1}, {{Vgpr64}, {VgprP1, VgprV2S64}}});
1010
1011 addRulesForGOpcs({G_AMDGPU_BUFFER_ATOMIC_CMPSWAP}, Standard)
1012 .Div(S32, {{Vgpr32},
1014 .Div(S64, {{Vgpr64},
1016
1017 addRulesForGOpcs({G_AMDGPU_BUFFER_ATOMIC_ADD, G_AMDGPU_BUFFER_ATOMIC_AND,
1018 G_AMDGPU_BUFFER_ATOMIC_DEC, G_AMDGPU_BUFFER_ATOMIC_FMAX,
1019 G_AMDGPU_BUFFER_ATOMIC_FMIN, G_AMDGPU_BUFFER_ATOMIC_INC,
1020 G_AMDGPU_BUFFER_ATOMIC_OR, G_AMDGPU_BUFFER_ATOMIC_SMAX,
1021 G_AMDGPU_BUFFER_ATOMIC_SMIN, G_AMDGPU_BUFFER_ATOMIC_SUB,
1022 G_AMDGPU_BUFFER_ATOMIC_SWAP, G_AMDGPU_BUFFER_ATOMIC_UMAX,
1023 G_AMDGPU_BUFFER_ATOMIC_UMIN, G_AMDGPU_BUFFER_ATOMIC_XOR},
1024 Standard)
1027
1028 bool hasSMRDx3 = ST->hasScalarDwordx3Loads();
1029 bool hasSMRDSmall = ST->hasScalarSubwordLoads();
1030 bool usesTrue16 = ST->useRealTrue16Insts();
1031
1032 Predicate isAlign16([](const MachineInstr &MI) -> bool {
1033 return (*MI.memoperands_begin())->getAlign() >= Align(16);
1034 });
1035
1036 Predicate isAlign4([](const MachineInstr &MI) -> bool {
1037 return (*MI.memoperands_begin())->getAlign() >= Align(4);
1038 });
1039
1040 Predicate isAtomicMMO([](const MachineInstr &MI) -> bool {
1041 return (*MI.memoperands_begin())->isAtomic();
1042 });
1043
1044 Predicate isUniMMO([](const MachineInstr &MI) -> bool {
1045 return AMDGPU::isUniformMMO(*MI.memoperands_begin());
1046 });
1047
1048 Predicate isConst([](const MachineInstr &MI) -> bool {
1049 // Address space in MMO be different then address space on pointer.
1050 const MachineMemOperand *MMO = *MI.memoperands_begin();
1051 const unsigned AS = MMO->getAddrSpace();
1052 return AS == AMDGPUAS::CONSTANT_ADDRESS ||
1054 });
1055
1056 Predicate isVolatileMMO([](const MachineInstr &MI) -> bool {
1057 return (*MI.memoperands_begin())->isVolatile();
1058 });
1059
1060 Predicate isInvMMO([](const MachineInstr &MI) -> bool {
1061 return (*MI.memoperands_begin())->isInvariant();
1062 });
1063
1064 Predicate isNoClobberMMO([](const MachineInstr &MI) -> bool {
1065 return (*MI.memoperands_begin())->getFlags() & MONoClobber;
1066 });
1067
1068 Predicate isNaturalAligned([](const MachineInstr &MI) -> bool {
1069 const MachineMemOperand *MMO = *MI.memoperands_begin();
1070 return MMO->getAlign() >= Align(MMO->getSize().getValue());
1071 });
1072
1073 Predicate is8Or16BitMMO([](const MachineInstr &MI) -> bool {
1074 const MachineMemOperand *MMO = *MI.memoperands_begin();
1075 const unsigned MemSize = 8 * MMO->getSize().getValue();
1076 return MemSize == 16 || MemSize == 8;
1077 });
1078
1079 Predicate is32BitMMO([](const MachineInstr &MI) -> bool {
1080 const MachineMemOperand *MMO = *MI.memoperands_begin();
1081 return 8 * MMO->getSize().getValue() == 32;
1082 });
1083
1084 auto isUL = !isAtomicMMO && isUniMMO && (isConst || !isVolatileMMO) &&
1085 (isConst || isInvMMO || isNoClobberMMO);
1086
1087 // clang-format off
1088 // TODO: S32Dst, 16-bit any-extending load should not appear on True16 targets
1089 addRulesForGOpcs({G_LOAD})
1090 // flat, addrspace(0), never uniform - flat_load
1091 .Any({{DivS16, P0}, {{Vgpr16}, {VgprP0}}}, usesTrue16)
1092 .Any({{DivB32, P0}, {{VgprB32}, {VgprP0}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1093 .Any({{DivB64, P0}, {{VgprB64}, {VgprP0}}})
1094 .Any({{DivB96, P0}, {{VgprB96}, {VgprP0}}})
1095 .Any({{DivB128, P0}, {{VgprB128}, {VgprP0}}})
1096
1097 // global, addrspace(1)
1098 // divergent - global_load
1099 .Any({{DivS16, P1}, {{Vgpr16}, {VgprP1}}}, usesTrue16)
1100 .Any({{DivB32, P1}, {{VgprB32}, {VgprP1}}}) //32-bit load, 8-bit and 16-bit any-extending load
1101 .Any({{DivB64, P1}, {{VgprB64}, {VgprP1}}})
1102 .Any({{DivB96, P1}, {{VgprB96}, {VgprP1}}})
1103 .Any({{DivB128, P1}, {{VgprB128}, {VgprP1}}})
1104 .Any({{DivB256, P1}, {{VgprB256}, {VgprP1}, SplitLoad}})
1105 .Any({{DivB512, P1}, {{VgprB512}, {VgprP1}, SplitLoad}})
1106
1107 // uniform - s_load
1108 .Any({{{UniS16, P1}, isNaturalAligned && isUL}, {{Sgpr32Trunc}, {SgprP1}}}, usesTrue16 && hasSMRDSmall) // s16 load
1109 .Any({{{UniS16, P1}, isAlign4 && isUL}, {{Sgpr32Trunc}, {SgprP1}, WidenMMOToS32}}, usesTrue16 && !hasSMRDSmall) // s16 load to 32-bit load
1110 .Any({{{UniB32, P1}, isNaturalAligned && isUL}, {{SgprB32}, {SgprP1}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1111 // TODO: SplitLoad when !isNaturalAligned && isUL and target hasSMRDSmall
1112 .Any({{{UniB32, P1}, is8Or16BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP1}, WidenMMOToS32}}, !hasSMRDSmall) //8-bit and 16-bit any-extending load to 32-bit load
1113 .Any({{{UniB32, P1}, is32BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP1}}}) //32-bit load
1114 .Any({{{UniB64, P1}, isAlign4 && isUL}, {{SgprB64}, {SgprP1}}})
1115 .Any({{{UniB96, P1}, isAlign16 && isUL}, {{SgprB96}, {SgprP1}, WidenLoad}}, !hasSMRDx3)
1116 .Any({{{UniB96, P1}, isAlign4 && !isAlign16 && isUL}, {{SgprB96}, {SgprP1}, SplitLoad}}, !hasSMRDx3)
1117 .Any({{{UniB96, P1}, isAlign4 && isUL}, {{SgprB96}, {SgprP1}}}, hasSMRDx3)
1118 .Any({{{UniB128, P1}, isAlign4 && isUL}, {{SgprB128}, {SgprP1}}})
1119 .Any({{{UniB256, P1}, isAlign4 && isUL}, {{SgprB256}, {SgprP1}}})
1120 .Any({{{UniB512, P1}, isAlign4 && isUL}, {{SgprB512}, {SgprP1}}})
1121
1122 // Uniform via global or buffer load, for example volatile or non-aligned
1123 // uniform load. Not using standard {{UniInVgprTy}, {VgprP1}} since it is
1124 // selected as global_load, use SgprP1 for pointer instead to match
1125 // patterns without flat-for-global, default for GFX7 and older.
1126 // -> +flat-for-global + {{UniInVgprTy}, {SgprP1}} - global_load
1127 // -> -flat-for-global + {{UniInVgprTy}, {SgprP1}} - buffer_load
1128 .Any({{{UniS16, P1}, !isNaturalAligned || !isUL}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && hasSMRDSmall) // s16 load
1129 .Any({{{UniS16, P1}, !isAlign4 || !isUL}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && !hasSMRDSmall) // s16 load
1130 .Any({{{UniB32, P1}, !isNaturalAligned || !isUL}, {{UniInVgprB32}, {SgprP1}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1131 .Any({{{UniB32, P1}, !isAlign4 || !isUL}, {{UniInVgprB32}, {SgprP1}}}, !hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1132 .Any({{{UniB64, P1}, !isAlign4 || !isUL}, {{UniInVgprB64}, {SgprP1}}})
1133 .Any({{{UniB96, P1}, !isAlign4 || !isUL}, {{UniInVgprB96}, {SgprP1}}})
1134 .Any({{{UniB128, P1}, !isAlign4 || !isUL}, {{UniInVgprB128}, {SgprP1}}})
1135 .Any({{{UniB256, P1}, !isAlign4 || !isUL}, {{UniInVgprB256}, {SgprP1}, SplitLoad}})
1136 .Any({{{UniB512, P1}, !isAlign4 || !isUL}, {{UniInVgprB512}, {SgprP1}, SplitLoad}})
1137
1138 // local, addrspace(3) - ds_load
1139 .Any({{DivS16, P3}, {{Vgpr16}, {VgprP3}}}, usesTrue16)
1140 .Any({{DivB32, P3}, {{VgprB32}, {VgprP3}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1141 .Any({{DivB64, P3}, {{VgprB64}, {VgprP3}}})
1142 .Any({{DivB96, P3}, {{VgprB96}, {VgprP3}}})
1143 .Any({{DivB128, P3}, {{VgprB128}, {VgprP3}}})
1144
1145 .Any({{UniS16, P3}, {{UniInVgprS16}, {SgprP3}}}, usesTrue16) // 16-bit load
1146 .Any({{UniB32, P3}, {{UniInVgprB32}, {VgprP3}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1147 .Any({{UniB64, P3}, {{UniInVgprB64}, {VgprP3}}})
1148 .Any({{UniB96, P3}, {{UniInVgprB96}, {VgprP3}}})
1149 .Any({{UniB128, P3}, {{UniInVgprB128}, {VgprP3}}})
1150
1151 // constant, addrspace(4)
1152 // divergent - global_load
1153 .Any({{DivS16, P4}, {{Vgpr16}, {VgprP4}}}, usesTrue16)
1154 .Any({{DivB32, P4}, {{VgprB32}, {VgprP4}}}) //32-bit load, 8-bit and 16-bit any-extending load
1155 .Any({{DivB64, P4}, {{VgprB64}, {VgprP4}}})
1156 .Any({{DivB96, P4}, {{VgprB96}, {VgprP4}}})
1157 .Any({{DivB128, P4}, {{VgprB128}, {VgprP4}}})
1158 .Any({{DivB256, P4}, {{VgprB256}, {VgprP4}, SplitLoad}})
1159 .Any({{DivB512, P4}, {{VgprB512}, {VgprP4}, SplitLoad}})
1160
1161 // uniform - s_load
1162 .Any({{{UniS16, P4}, isNaturalAligned && isUL}, {{Sgpr32Trunc}, {SgprP4}}}, usesTrue16 && hasSMRDSmall) // s16 load
1163 .Any({{{UniS16, P4}, isAlign4 && isUL}, {{Sgpr32Trunc}, {SgprP4}, WidenMMOToS32}}, usesTrue16 && !hasSMRDSmall) // s16 load to 32-bit load
1164 .Any({{{UniB32, P4}, isNaturalAligned && isUL}, {{SgprB32}, {SgprP4}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1165 .Any({{{UniB32, P4}, is8Or16BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP4}, WidenMMOToS32}}, !hasSMRDSmall) //8-bit and 16-bit any-extending load to 32-bit load
1166 .Any({{{UniB32, P4}, is32BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP4}}}) //32-bit load
1167 .Any({{{UniB64, P4}, isAlign4 && isUL}, {{SgprB64}, {SgprP4}}})
1168 .Any({{{UniB96, P4}, isAlign16 && isUL}, {{SgprB96}, {SgprP4}, WidenLoad}}, !hasSMRDx3)
1169 .Any({{{UniB96, P4}, isAlign4 && !isAlign16 && isUL}, {{SgprB96}, {SgprP4}, SplitLoad}}, !hasSMRDx3)
1170 .Any({{{UniB96, P4}, isAlign4 && isUL}, {{SgprB96}, {SgprP4}}}, hasSMRDx3)
1171 .Any({{{UniB128, P4}, isAlign4 && isUL}, {{SgprB128}, {SgprP4}}})
1172 .Any({{{UniB256, P4}, isAlign4 && isUL}, {{SgprB256}, {SgprP4}}})
1173 .Any({{{UniB512, P4}, isAlign4 && isUL}, {{SgprB512}, {SgprP4}}})
1174
1175 // uniform in vgpr - global_load or buffer_load
1176 .Any({{{UniS16, P4}, !isNaturalAligned || !isUL}, {{UniInVgprS16}, {SgprP4}}}, usesTrue16 && hasSMRDSmall) // s16 load
1177 .Any({{{UniS16, P4}, !isAlign4 || !isUL}, {{UniInVgprS16}, {SgprP4}}}, usesTrue16 && !hasSMRDSmall) // s16 load
1178 .Any({{{UniB32, P4}, !isNaturalAligned || !isUL}, {{UniInVgprB32}, {SgprP4}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1179 .Any({{{UniB32, P4}, !isAlign4 || !isUL}, {{UniInVgprB32}, {SgprP4}}}, !hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1180 .Any({{{UniB64, P4}, !isAlign4 || !isUL}, {{UniInVgprB64}, {SgprP4}}})
1181 .Any({{{UniB96, P4}, !isAlign4 || !isUL}, {{UniInVgprB96}, {SgprP4}}})
1182 .Any({{{UniB128, P4}, !isAlign4 || !isUL}, {{UniInVgprB128}, {SgprP4}}})
1183 .Any({{{UniB256, P4}, !isAlign4 || !isUL}, {{UniInVgprB256}, {SgprP4}, SplitLoad}})
1184 .Any({{{UniB512, P4}, !isAlign4 || !isUL}, {{UniInVgprB512}, {SgprP4}, SplitLoad}})
1185
1186 // private, addrspace(5), never uniform - scratch_load
1187 .Any({{DivS16, P5}, {{Vgpr16}, {VgprP5}}}, usesTrue16)
1188 .Any({{DivB32, P5}, {{VgprB32}, {VgprP5}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1189 .Any({{DivB64, P5}, {{VgprB64}, {VgprP5}}})
1190 .Any({{DivB96, P5}, {{VgprB96}, {VgprP5}}})
1191 .Any({{DivB128, P5}, {{VgprB128}, {VgprP5}}})
1192
1193 .Any({{DivS32, Ptr128}, {{Vgpr32}, {VgprPtr128}}});
1194
1195
1196 addRulesForGOpcs({G_ZEXTLOAD, G_SEXTLOAD}) // i8 and i16 zeroextending loads
1197 .Any({{DivS32, P0}, {{Vgpr32}, {VgprP0}}})
1198 .Any({{DivS16, P0}, {{Vgpr16}, {VgprP0}}}, usesTrue16)
1199
1200 .Any({{DivS32, P1}, {{Vgpr32}, {VgprP1}}})
1201 .Any({{DivS16, P1}, {{Vgpr16}, {VgprP1}}}, usesTrue16)
1202 .Any({{{UniS32, P1}, isAlign4 && isUL}, {{Sgpr32}, {SgprP1}, WidenMMOToS32}}, !hasSMRDSmall)
1203 .Any({{{UniS32, P1}, isNaturalAligned && isUL}, {{Sgpr32}, {SgprP1}}}, hasSMRDSmall)
1204 .Any({{{UniS32, P1}, !isAlign4 || !isUL}, {{UniInVgprS32}, {SgprP1}}}, !hasSMRDSmall)
1205 .Any({{{UniS32, P1}, !isNaturalAligned || !isUL}, {{UniInVgprS32}, {SgprP1}}}, hasSMRDSmall)
1206
1207 .Any({{DivS32, P3}, {{Vgpr32}, {VgprP3}}})
1208 .Any({{DivS16, P3}, {{Vgpr16}, {VgprP3}}}, usesTrue16)
1209 .Any({{UniS32, P3}, {{UniInVgprS32}, {VgprP3}}})
1210
1211 .Any({{DivS32, P4}, {{Vgpr32}, {VgprP4}}})
1212 .Any({{DivS16, P4}, {{Vgpr16}, {VgprP4}}}, usesTrue16)
1213 .Any({{{UniS32, P4}, isAlign4 && isUL}, {{Sgpr32}, {SgprP4}, WidenMMOToS32}}, !hasSMRDSmall)
1214 .Any({{{UniS32, P4}, isNaturalAligned && isUL}, {{Sgpr32}, {SgprP4}}}, hasSMRDSmall)
1215 .Any({{{UniS32, P4}, !isAlign4 || !isUL}, {{UniInVgprS32}, {SgprP4}}}, !hasSMRDSmall)
1216 .Any({{{UniS32, P4}, !isNaturalAligned || !isUL}, {{UniInVgprS32}, {SgprP4}}}, hasSMRDSmall)
1217
1218 .Any({{DivS32, P5}, {{Vgpr32}, {VgprP5}}})
1219 .Any({{DivS16, P5}, {{Vgpr16}, {VgprP5}}}, usesTrue16);
1220
1221 addRulesForGOpcs({G_STORE})
1222 // addrspace(0)
1223 .Any({{S16, P0}, {{}, {Vgpr16, VgprP0}}}, usesTrue16) // 16-bit store
1224 .Any({{B32, P0}, {{}, {VgprB32, VgprP0}}}) // 32-bit store, 8-bit and 16-bit truncating store
1225 .Any({{B64, P0}, {{}, {VgprB64, VgprP0}}})
1226 .Any({{B96, P0}, {{}, {VgprB96, VgprP0}}})
1227 .Any({{B128, P0}, {{}, {VgprB128, VgprP0}}})
1228
1229 // addrspace(1), there are no stores to addrspace(4)
1230 // For targets:
1231 // - with "+flat-for-global" - global_store
1232 // - without(-flat-for-global) - buffer_store addr64
1233 .Any({{S16, DivP1}, {{}, {Vgpr16, VgprP1}}}, usesTrue16) // 16-bit store
1234 .Any({{B32, DivP1}, {{}, {VgprB32, VgprP1}}}) // 32-bit store, 8-bit and 16-bit truncating store
1235 .Any({{B64, DivP1}, {{}, {VgprB64, VgprP1}}})
1236 .Any({{B96, DivP1}, {{}, {VgprB96, VgprP1}}})
1237 .Any({{B128, DivP1}, {{}, {VgprB128, VgprP1}}})
1238
1239 // For UniP1, use sgpr ptr to match flat-for-global patterns. Targets:
1240 // - with "+flat-for-global" - global_store for both sgpr and vgpr ptr
1241 // - without(-flat-for-global) - need sgpr ptr to select buffer_store
1242 .Any({{S16, UniP1}, {{}, {Vgpr16, SgprP1}}}, usesTrue16) // 16-bit store
1243 .Any({{B32, UniP1}, {{}, {VgprB32, SgprP1}}}) // 32-bit store, 8-bit and 16-bit truncating store
1244 .Any({{B64, UniP1}, {{}, {VgprB64, SgprP1}}})
1245 .Any({{B96, UniP1}, {{}, {VgprB96, SgprP1}}})
1246 .Any({{B128, UniP1}, {{}, {VgprB128, SgprP1}}})
1247
1248 // addrspace(3) and addrspace(5)
1249 .Any({{S16, Ptr32}, {{}, {Vgpr16, VgprPtr32}}}, usesTrue16) // 16-bit store
1250 .Any({{B32, Ptr32}, {{}, {VgprB32, VgprPtr32}}}) // 32-bit store, 8-bit and 16-bit truncating store
1251 .Any({{B64, Ptr32}, {{}, {VgprB64, VgprPtr32}}})
1252 .Any({{B96, Ptr32}, {{}, {VgprB96, VgprPtr32}}})
1253 .Any({{B128, Ptr32}, {{}, {VgprB128, VgprPtr32}}});
1254
1255 // clang-format on
1256
1257 addRulesForGOpcs({G_AMDGPU_BUFFER_LOAD, G_AMDGPU_BUFFER_LOAD_FORMAT,
1258 G_AMDGPU_TBUFFER_LOAD_FORMAT},
1259 StandardB)
1268
1269 addRulesForGOpcs({G_AMDGPU_BUFFER_LOAD_USHORT, G_AMDGPU_BUFFER_LOAD_UBYTE,
1270 G_AMDGPU_BUFFER_LOAD_SSHORT, G_AMDGPU_BUFFER_LOAD_SBYTE},
1271 StandardB)
1274
1275 addRulesForGOpcs(
1276 {G_AMDGPU_BUFFER_LOAD_UBYTE_TFE, G_AMDGPU_BUFFER_LOAD_USHORT_TFE},
1277 StandardB)
1280
1281 addRulesForGOpcs({G_AMDGPU_BUFFER_LOAD_TFE, G_AMDGPU_BUFFER_LOAD_FORMAT_TFE},
1282 StandardB)
1290 .Any({{UniB160},
1292
1293 addRulesForGOpcs(
1294 {G_AMDGPU_BUFFER_LOAD_FORMAT_D16, G_AMDGPU_TBUFFER_LOAD_FORMAT_D16},
1295 StandardB)
1302
1303 addRulesForGOpcs({G_AMDGPU_S_BUFFER_LOAD})
1304 // waterfall expansion is part of S_BUF_to_BUF
1305 .Any({{UniB32}, {{SgprB32}, {SgprV4S32, Sgpr32}}})
1306 .Any({{DivB32, UniV4S32, DivB32},
1308 .Any({{DivB32, DivV4S32, UniB32},
1310 .Any({{DivB32, DivV4S32, DivB32},
1312
1313 .Any({{UniB64}, {{SgprB64}, {SgprV4S32, Sgpr32}}})
1314 .Any({{DivB64, UniV4S32, DivB32},
1316 .Any({{DivB64, DivV4S32, UniB32},
1318 .Any({{DivB64, DivV4S32, DivB32},
1320
1321 .Any({{UniB96}, {{SgprB96}, {SgprV4S32, Sgpr32}}})
1322 .Any({{DivB96, UniV4S32, DivB32},
1324 .Any({{DivB96, DivV4S32, UniB32},
1326 .Any({{DivB96, DivV4S32, DivB32},
1328
1329 .Any({{UniB128}, {{SgprB128}, {SgprV4S32, Sgpr32}}})
1330 .Any({{DivB128, UniV4S32, DivB32},
1332 .Any({{DivB128, DivV4S32, UniB32},
1334 .Any({{DivB128, DivV4S32, DivB32},
1336
1337 .Any({{UniB256}, {{SgprB256}, {SgprV4S32, Sgpr32}}})
1338 .Any({{DivB256, UniV4S32, DivB32},
1340 .Any({{DivB256, DivV4S32, UniB32},
1342 .Any({{DivB256, DivV4S32, DivB32},
1344
1345 .Any({{UniB512}, {{SgprB512}, {SgprV4S32, Sgpr32}}})
1346 .Any({{DivB512, UniV4S32, DivB32},
1348 .Any({{DivB512, DivV4S32, UniB32},
1350 .Any({{DivB512, DivV4S32, DivB32},
1352
1353 addRulesForGOpcs({G_AMDGPU_S_BUFFER_LOAD_SBYTE, G_AMDGPU_S_BUFFER_LOAD_UBYTE,
1354 G_AMDGPU_S_BUFFER_LOAD_SSHORT,
1355 G_AMDGPU_S_BUFFER_LOAD_USHORT})
1357 .Any({{DivS32, UniV4S32, DivS32},
1359 .Any({{DivS32, DivV4S32, UniS32},
1361 .Any({{DivS32, DivV4S32, DivS32},
1363
1364 addRulesForGOpcs({G_AMDGPU_BUFFER_STORE, G_AMDGPU_BUFFER_STORE_BYTE,
1365 G_AMDGPU_BUFFER_STORE_SHORT, G_AMDGPU_BUFFER_STORE_FORMAT,
1366 G_AMDGPU_BUFFER_STORE_FORMAT_D16,
1367 G_AMDGPU_TBUFFER_STORE_FORMAT,
1368 G_AMDGPU_TBUFFER_STORE_FORMAT_D16})
1369 .Any({{B32}, {{}, {VgprB32, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}})
1370 .Any({{B64}, {{}, {VgprB64, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}})
1371 .Any({{B96}, {{}, {VgprB96, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}})
1372 .Any({{B128}, {{}, {VgprB128, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}});
1373
1374 // Buffer atomics: resource descriptor + scalar offset are SGPR, data and
1375 // address components are VGPR.
1376 //
1377 // Operand order (SIInstructions.td BufferAtomicGenericInstruction):
1378 // dst = op vdata, rsrc, vindex, voffset, soffset, offset_imm, cachepolicy,
1379 // idxen_imm
1380 addRulesForGOpcs({G_AMDGPU_BUFFER_ATOMIC_FADD})
1381 .Any({{S32, S32, V4S32, S32, S32, S32},
1383 .Any({{S64, S64, V4S32, S32, S32, S32},
1385 .Any({{V2S16, V2S16, V4S32, S32, S32, S32},
1386 {{VgprV2S16},
1388
1389 addRulesForGOpcs({G_PTR_ADD})
1390 .Any({{UniPtr32}, {{SgprPtr32}, {SgprPtr32, Sgpr32}}})
1391 .Any({{DivPtr32}, {{VgprPtr32}, {VgprPtr32, Vgpr32}}})
1392 .Any({{UniPtr64}, {{SgprPtr64}, {SgprPtr64, Sgpr64}}})
1393 .Any({{DivPtr64}, {{VgprPtr64}, {VgprPtr64, Vgpr64}}});
1394
1395 addRulesForGOpcs({G_INTTOPTR})
1396 .Any({{UniPtr32}, {{SgprPtr32}, {Sgpr32}}})
1397 .Any({{DivPtr32}, {{VgprPtr32}, {Vgpr32}}})
1398 .Any({{UniPtr64}, {{SgprPtr64}, {Sgpr64}}})
1399 .Any({{DivPtr64}, {{VgprPtr64}, {Vgpr64}}})
1400 .Any({{UniPtr128}, {{SgprPtr128}, {Sgpr128}}})
1401 .Any({{DivPtr128}, {{VgprPtr128}, {Vgpr128}}});
1402
1403 addRulesForGOpcs({G_PTRTOINT})
1404 .Any({{UniS32}, {{Sgpr32}, {SgprPtr32}}})
1405 .Any({{DivS32}, {{Vgpr32}, {VgprPtr32}}})
1406 .Any({{UniS64}, {{Sgpr64}, {SgprPtr64}}})
1407 .Any({{DivS64}, {{Vgpr64}, {VgprPtr64}}})
1408 .Any({{UniS128}, {{Sgpr128}, {SgprPtr128}}})
1409 .Any({{DivS128}, {{Vgpr128}, {VgprPtr128}}});
1410
1411 // FIXME: Update llvm/test/CodeGen/AMDGPU/ptrmask.ll to use GlobalISel.
1412 // Currently crashes on P8 (buffer resource) tests due to legalizer issue.
1413 addRulesForGOpcs({G_PTRMASK})
1414 .Any({{UniP1}, {{SgprP1}, {SgprP1, Sgpr64}}})
1415 .Any({{DivP1}, {{VgprP1}, {VgprP1, Vgpr64}}})
1416 .Any({{UniP3}, {{SgprP3}, {SgprP3, Sgpr32}}})
1417 .Any({{DivP3}, {{VgprP3}, {VgprP3, Vgpr32}}});
1418
1419 addRulesForGOpcs({G_DYN_STACKALLOC})
1420 .Any({{UniP5, UniS32}, {{SgprP5}, {Sgpr32}, DynStackAlloc}})
1421 .Any({{UniP5, DivS32}, {{SgprP5}, {Vgpr32}, DynStackAlloc}});
1422
1423 addRulesForGOpcs({G_ABS}, Standard)
1424 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32SExt}})
1425 .Div(S16, {{Vgpr16}, {Vgpr16}, AbsToNegMax})
1426 .Uni(S32, {{Sgpr32}, {Sgpr32}})
1427 .Div(S32, {{Vgpr32}, {Vgpr32}, AbsToNegMax})
1428 .Uni(V2S16, {{SgprV2S16}, {SgprV2S16}, AbsToS32})
1429 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}, AbsToNegMax});
1430
1431 addRulesForGOpcs({G_BITREVERSE}, Standard)
1432 .Uni(S32, {{Sgpr32}, {Sgpr32}})
1433 .Div(S32, {{Vgpr32}, {Vgpr32}})
1434 .Uni(S64, {{Sgpr64}, {Sgpr64}})
1435 .Div(S64, {{Vgpr64}, {Vgpr64}});
1436
1437 addRulesForGOpcs({G_AMDGPU_FFBH_U32, G_AMDGPU_FFBL_B32, G_CTLZ_ZERO_POISON,
1438 G_CTTZ_ZERO_POISON})
1439 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}})
1440 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1441 .Any({{UniS32, S64}, {{Sgpr32}, {Sgpr64}}})
1443
1444 addRulesForGOpcs({G_CTPOP})
1445 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}})
1446 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1447 .Any({{UniS32, S64}, {{Sgpr32}, {Sgpr64}}})
1448 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}, CtPop64To32}});
1449
1450 addRulesForGOpcs({G_FENCE}).Any({{{}}, {{}, {}}});
1451
1452 addRulesForGOpcs({G_READSTEADYCOUNTER, G_READCYCLECOUNTER}, Standard)
1453 .Uni(S64, {{Sgpr64}, {}});
1454
1455 addRulesForGOpcs({G_GET_ROUNDING}, Standard)
1456 .Uni(S32, {{Sgpr32}, {}, LowerGetRounding});
1457
1458 addRulesForGOpcs({G_SET_ROUNDING}, Standard)
1461
1462 addRulesForGOpcs({G_BLOCK_ADDR}).Any({{UniP0}, {{SgprP0}, {}}});
1463
1464 addRulesForGOpcs({G_GLOBAL_VALUE})
1465 .Any({{UniP0}, {{SgprP0}, {}}})
1466 .Any({{UniP1}, {{SgprP1}, {}}})
1467 .Any({{UniP3}, {{SgprP3}, {}}})
1468 .Any({{UniP4}, {{SgprP4}, {}}})
1469 .Any({{UniP8}, {{SgprP8}, {}}});
1470
1471 addRulesForGOpcs({G_AMDGPU_WAVE_ADDRESS}).Any({{UniP5}, {{SgprP5}, {}}});
1472
1473 addRulesForGOpcs({G_AMDGPU_SPONENTRY}, Standard).Uni(S32, {{Sgpr32}, {}});
1474
1475 addRulesForGOpcs({G_SI_CALL})
1476 .Any({{_, UniP0}, {{None}, {SgprP0}}})
1477 .Any({{_, DivP0}, {{None}, {SgprP0Call_WF}}})
1478 .Any({{_, UniP4}, {{None}, {SgprP4}}})
1479 .Any({{_, DivP4}, {{None}, {SgprP4Call_WF}}});
1480
1481 bool hasSALUFloat = ST->hasSALUFloatInsts();
1482
1483 addRulesForGOpcs({G_FADD, G_FMUL, G_STRICT_FADD, G_STRICT_FMUL}, Standard)
1484 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUFloat)
1485 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUFloat)
1486 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1487 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUFloat)
1488 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUFloat)
1489 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1490 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
1491 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
1492 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16, VgprV2S16}}, !hasSALUFloat)
1494 hasSALUFloat)
1495 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
1499 .Any({{DivV2S64}, {{VgprV2S64}, {VgprV2S64, VgprV2S64}}});
1500
1501 addRulesForGOpcs({G_FSUB, G_STRICT_FSUB}, Standard)
1502 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1503 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1504 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUFloat)
1505 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUFloat)
1506 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUFloat)
1507 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUFloat);
1508
1509 addRulesForGOpcs({G_FMAD}, Standard)
1510 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16, Vgpr16}})
1511 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16, Vgpr16}})
1512 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
1513 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
1514
1515 addRulesForGOpcs({G_FLDEXP, G_STRICT_FLDEXP}, Standard)
1516 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}})
1517 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1518 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}})
1519 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1520 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr32}})
1521 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
1522
1523 addRulesForGOpcs({G_FMA, G_STRICT_FMA}, Standard)
1524 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16, Vgpr16}})
1525 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}})
1526 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64, Vgpr64}})
1527 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64, Vgpr64}})
1531 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16, Sgpr16}}, hasSALUFloat)
1532 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16, Vgpr16}}, !hasSALUFloat)
1533 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32, Sgpr32}}, hasSALUFloat)
1534 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}}, !hasSALUFloat)
1535 .Uni(V2S16,
1537 hasSALUFloat)
1539 !hasSALUFloat)
1542
1543 addRulesForGOpcs({G_AMDGPU_FMED3}, Standard)
1544 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16, Vgpr16}})
1545 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16, Vgpr16}})
1546 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
1547 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
1548
1549 // TODO: This opcode is generated from the i64->i16 signed clamped pattern in
1550 // the PreLegalizerCombiner. Move the combine to RegBankCombiner to keep more
1551 // instructions on SALU.
1552 addRulesForGOpcs({G_AMDGPU_SMED3}, Standard)
1553 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
1554 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
1555
1556 // FNEG and FABS are either folded as source modifiers or can be selected as
1557 // bitwise XOR and AND with Mask. XOR and AND are available on SALU but for
1558 // targets without SALU float we still select them as VGPR since there would
1559 // be no real sgpr use.
1560 addRulesForGOpcs({G_FNEG, G_FABS}, Standard)
1561 .Uni(S16, {{UniInVgprS16}, {Vgpr16}}, !hasSALUFloat)
1562 .Uni(S16, {{Sgpr16}, {Sgpr16}}, hasSALUFloat)
1563 .Div(S16, {{Vgpr16}, {Vgpr16}})
1564 .Uni(S32, {{UniInVgprS32}, {Vgpr32}}, !hasSALUFloat)
1565 .Uni(S32, {{Sgpr32}, {Sgpr32}}, hasSALUFloat)
1566 .Div(S32, {{Vgpr32}, {Vgpr32}})
1567 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1568 .Div(S64, {{Vgpr64}, {Vgpr64}})
1569 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16}}, !hasSALUFloat)
1570 .Uni(V2S16, {{SgprV2S16}, {SgprV2S16}, ScalarizeToS16}, hasSALUFloat)
1571 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}})
1572 .Any({{UniV2S32}, {{UniInVgprV2S32}, {VgprV2S32}}})
1573 .Any({{DivV2S32}, {{VgprV2S32}, {VgprV2S32}}});
1574
1575 addRulesForGOpcs({G_FCANONICALIZE}, Standard)
1576 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
1577 .Div(S32, {{Vgpr32}, {Vgpr32}})
1578 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
1579 .Div(S16, {{Vgpr16}, {Vgpr16}})
1580 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1581 .Div(S64, {{Vgpr64}, {Vgpr64}})
1582 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16}})
1583 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}})
1584 .Any({{UniV2S32}, {{UniInVgprV2S32}, {VgprV2S32}}})
1585 .Any({{DivV2S32}, {{VgprV2S32}, {VgprV2S32}}})
1586 .Any({{UniV2S64}, {{UniInVgprV2S64}, {VgprV2S64}}})
1587 .Any({{DivV2S64}, {{VgprV2S64}, {VgprV2S64}}});
1588
1589 bool hasPST = ST->hasPseudoScalarTrans();
1590 addRulesForGOpcs({G_FSQRT}, Standard)
1591 .Div(S16, {{Vgpr16}, {Vgpr16}})
1592 .Uni(S16, {{Sgpr16}, {Sgpr16}}, hasPST)
1593 .Uni(S16, {{UniInVgprS16}, {Vgpr16}}, !hasPST);
1594
1595 addRulesForGOpcs({G_FPTOUI, G_FPTOSI, G_FPTOUI_SAT, G_FPTOSI_SAT})
1596 .Any({{UniS16, S16}, {{UniInVgprS16}, {Vgpr16}}})
1597 .Any({{DivS16, S16}, {{Vgpr16}, {Vgpr16}}})
1598 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}}, hasSALUFloat)
1599 .Any({{UniS32, S16}, {{UniInVgprS32}, {Vgpr16}}}, !hasSALUFloat)
1600 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}})
1601 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1602 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat)
1603 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1604 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}}, hasSALUFloat)
1605 .Any({{UniS32, S32}, {{UniInVgprS32}, {Vgpr32}}}, !hasSALUFloat)
1606 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1607 .Any({{UniS32, S64}, {{UniInVgprS32}, {Vgpr64}}})
1608 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}}})
1610 .Any({{DivV2S16, V2S32}, {{VgprV2S16}, {VgprV2S32}}});
1611
1612 addRulesForGOpcs({G_UITOFP, G_SITOFP})
1613 .Any({{UniS16, S16}, {{UniInVgprS16}, {Vgpr16}}})
1614 .Any({{DivS16, S16}, {{Vgpr16}, {Vgpr16}}})
1615 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1616 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat)
1617 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1618 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}}, hasSALUFloat)
1619 .Any({{UniS32, S32}, {{UniInVgprS32}, {Vgpr32}}}, !hasSALUFloat)
1620 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1621 .Any({{UniS64, S32}, {{UniInVgprS64}, {Vgpr32}}})
1622 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}}});
1623
1624 addRulesForGOpcs({G_AMDGPU_S_BUFFER_PREFETCH})
1626
1627 Predicate IsDataPF([](const MachineInstr &MI) -> bool {
1628 // prefetch cache type: 0 == instruction (I$) prefetch, 1 == data prefetch.
1629 return MI.getOperand(3).getImm() != 0;
1630 });
1631
1632 bool HasSMemPF = ST->hasSafeSmemPrefetch();
1633 bool HasVMemPF = ST->hasVmemPrefInsts();
1634 addRulesForGOpcs({G_PREFETCH})
1635 // Safe smem prefetch keeps both data and instruction prefetch.
1636 .Any({{UniPtr64}, {{}, {SgprPtr64}}}, HasSMemPF)
1637 // Vmem prefetch keeps data prefetch only.
1638 .Any({{{UniPtr64}, IsDataPF}, {{}, {SgprPtr64}}}, !HasSMemPF && HasVMemPF)
1639 .Any({{{UniPtr64}, IsDataPF}, {{}, {}, DeletePrefetch}},
1640 !HasSMemPF && !HasVMemPF)
1641 .Any({{{UniPtr64}, !IsDataPF}, {{}, {}, DeletePrefetch}}, !HasSMemPF)
1642
1643 .Any({{{DivPtr64}, IsDataPF}, {{}, {VgprPtr64}}}, HasVMemPF)
1644 .Any({{{DivPtr64}, IsDataPF}, {{}, {}, DeletePrefetch}}, !HasVMemPF)
1645 .Any({{{DivPtr64}, !IsDataPF}, {{}, {}, DeletePrefetch}})
1646
1647 .Any({{P3}, {{}, {}, DeletePrefetch}})
1648 .Any({{P5}, {{}, {}, DeletePrefetch}})
1649 .Any({{UniP6}, {{}, {SgprP6}}}, HasSMemPF)
1650 .Any({{UniP6}, {{}, {}, DeletePrefetch}}, !HasSMemPF);
1651
1652 addRulesForGOpcs({G_FPEXT})
1653 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}})
1654 .Any({{UniS64, S32}, {{UniInVgprS64}, {Vgpr32}}})
1655 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}}})
1656 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}}, hasSALUFloat)
1657 .Any({{UniS32, S16}, {{UniInVgprS32}, {Vgpr16}}}, !hasSALUFloat);
1658
1659 addRulesForGOpcs({G_AMDGPU_CVT_PK_I16_I32}, Standard)
1660 .Uni(V2S16, {{UniInVgprV2S16}, {Vgpr32, Vgpr32}})
1661 .Div(V2S16, {{VgprV2S16}, {Vgpr32, Vgpr32}});
1662
1663 addRulesForGOpcs({G_AMDGPU_FMIN_LEGACY, G_AMDGPU_FMAX_LEGACY}, Standard)
1664 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}})
1665 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}});
1666
1667 bool hasSALUMinimumMaximumInsts = ST->hasSALUMinimumMaximumInsts();
1668
1669 addRulesForGOpcs({G_FMINIMUM, G_FMAXIMUM}, Standard)
1670 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUMinimumMaximumInsts)
1671 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUMinimumMaximumInsts)
1672 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1673 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUMinimumMaximumInsts)
1674 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUMinimumMaximumInsts)
1675 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1676 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
1677 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
1679 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}});
1680
1681 addRulesForGOpcs({G_FMINNUM_IEEE, G_FMAXNUM_IEEE, G_FMINNUM, G_FMAXNUM,
1682 G_FMINIMUMNUM, G_FMAXIMUMNUM},
1683 Standard)
1684 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1685 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1686 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
1687 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
1689 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
1690 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUFloat)
1691 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUFloat)
1692 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUFloat)
1693 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUFloat);
1694
1695 addRulesForGOpcs({G_FPTRUNC})
1696 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1697 .Any({{UniS32, S64}, {{UniInVgprS32}, {Vgpr64}}})
1698 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}}})
1700 .Any({{DivV2S16, V2S32}, {{VgprV2S16}, {VgprV2S32}}})
1701 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1702 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat);
1703
1704 addRulesForGOpcs({G_INTRINSIC_FPTRUNC_ROUND})
1705 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1706 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat)
1707 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1708 .Any({{UniS16, S64}, {{UniInVgprS16}, {Vgpr64}}})
1709 .Any({{DivS16, S64}, {{Vgpr16}, {Vgpr64}}})
1710 .Any({{UniS32, S64}, {{UniInVgprS32}, {Vgpr64}}})
1711 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}}});
1712
1713 addRulesForGOpcs({G_IS_FPCLASS})
1714 .Any({{DivS1, S16}, {{Vcc}, {Vgpr16}}})
1715 .Any({{UniS1, S16}, {{UniInVcc}, {Vgpr16}}})
1716 .Any({{DivS1, S32}, {{Vcc}, {Vgpr32}}})
1717 .Any({{UniS1, S32}, {{UniInVcc}, {Vgpr32}}})
1718 .Any({{DivS1, S64}, {{Vcc}, {Vgpr64}}})
1719 .Any({{UniS1, S64}, {{UniInVcc}, {Vgpr64}}});
1720
1721 addRulesForGOpcs({G_FCMP}, Standard)
1722 .Any({{UniS1, _, S16}, {{Sgpr32Trunc}, {None, Sgpr16, Sgpr16}}},
1723 hasSALUFloat)
1724 .Any({{UniS1, _, S16}, {{UniInVcc}, {None, Vgpr16, Vgpr16}}},
1725 !hasSALUFloat)
1726 .Any({{DivS1, _, S16}, {{Vcc}, {None, Vgpr16, Vgpr16}}})
1727 .Any({{UniS1, _, S32}, {{Sgpr32Trunc}, {None, Sgpr32, Sgpr32}}},
1728 hasSALUFloat)
1729 .Any({{UniS1, _, S32}, {{UniInVcc}, {None, Vgpr32, Vgpr32}}},
1730 !hasSALUFloat)
1731 .Any({{DivS1, _, S32}, {{Vcc}, {None, Vgpr32, Vgpr32}}})
1732 .Any({{UniS1, _, S64}, {{UniInVcc}, {None, Vgpr64, Vgpr64}}})
1733 .Any({{DivS1, _, S64}, {{Vcc}, {None, Vgpr64, Vgpr64}}});
1734
1735 addRulesForGOpcs({G_INTRINSIC_ROUNDEVEN, G_FEXP2, G_FLOG2}, Standard)
1736 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
1737 .Div(S16, {{Vgpr16}, {Vgpr16}})
1738 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
1739 .Div(S32, {{Vgpr32}, {Vgpr32}})
1740 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1741 .Div(S64, {{Vgpr64}, {Vgpr64}});
1742
1743 addRulesForGOpcs({G_INTRINSIC_TRUNC, G_FFLOOR, G_FCEIL}, Standard)
1744 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
1745 .Uni(S16, {{Sgpr16}, {Sgpr16}}, hasSALUFloat)
1746 .Div(S16, {{Vgpr16}, {Vgpr16}})
1747 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
1748 .Uni(S32, {{Sgpr32}, {Sgpr32}}, hasSALUFloat)
1749 .Div(S32, {{Vgpr32}, {Vgpr32}})
1750 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1751 .Div(S64, {{Vgpr64}, {Vgpr64}});
1752
1753 addRulesForGOpcs({G_AMDGPU_GLOBAL_LOAD_MONITOR, G_AMDGPU_FLAT_LOAD_MONITOR},
1754 StandardB)
1755 .Uni(B32, {{UniInVgprB32}, {SgprPtr64}})
1756 .Div(B32, {{VgprB32}, {VgprPtr64}})
1757 .Uni(B64, {{UniInVgprB64}, {SgprPtr64}})
1758 .Div(B64, {{VgprB64}, {VgprPtr64}})
1759 .Uni(B128, {{UniInVgprB128}, {SgprPtr64}})
1760 .Div(B128, {{VgprB128}, {VgprPtr64}});
1761
1762 addRulesForGOpcs({G_AMDGPU_WHOLE_WAVE_FUNC_SETUP})
1763 .Any({{DivS1}, {{Vcc}, {}}});
1764
1765 addRulesForGOpcs({G_AMDGPU_WHOLE_WAVE_FUNC_RETURN}).Any({{}, {{}, {Vcc}}});
1766
1767 using namespace Intrinsic;
1768
1769 addRulesForIOpcs({returnaddress}).Any({{UniP0}, {{SgprP0}, {}}});
1770
1771 // Note: amdgcn.icmp with i1 inputs is legalized to ballot in the legalizer,
1772 // so no S1 rules are needed here.
1773 addRulesForIOpcs({amdgcn_icmp})
1774 .Any({{UniS64, _, S16}, {{Sgpr64}, {IntrId, Vgpr16, Vgpr16}}})
1775 .Any({{UniS64, _, S32}, {{Sgpr64}, {IntrId, Vgpr32, Vgpr32}}})
1776 .Any({{UniS64, _, S64}, {{Sgpr64}, {IntrId, Vgpr64, Vgpr64}}})
1777
1778 .Any({{UniS32, _, S16}, {{Sgpr32}, {IntrId, Vgpr16, Vgpr16}}})
1779 .Any({{UniS32, _, S32}, {{Sgpr32}, {IntrId, Vgpr32, Vgpr32}}})
1780 .Any({{UniS32, _, S64}, {{Sgpr32}, {IntrId, Vgpr64, Vgpr64}}});
1781
1782 addRulesForIOpcs({amdgcn_fcmp})
1783 .Any({{UniS64, _, S16}, {{Sgpr64}, {IntrId, Vgpr16, Vgpr16}}})
1784 .Any({{UniS64, _, S32}, {{Sgpr64}, {IntrId, Vgpr32, Vgpr32}}})
1785 .Any({{UniS64, _, S64}, {{Sgpr64}, {IntrId, Vgpr64, Vgpr64}}})
1786
1787 .Any({{UniS32, _, S16}, {{Sgpr32}, {IntrId, Vgpr16, Vgpr16}}})
1788 .Any({{UniS32, _, S32}, {{Sgpr32}, {IntrId, Vgpr32, Vgpr32}}})
1789 .Any({{UniS32, _, S64}, {{Sgpr32}, {IntrId, Vgpr64, Vgpr64}}});
1790
1791 addRulesForIOpcs({amdgcn_s_getpc}).Any({{UniS64, _}, {{Sgpr64}, {}}});
1792
1793 addRulesForIOpcs({amdgcn_s_getreg}).Any({{}, {{Sgpr32}, {IntrId}}});
1794
1795 addRulesForIOpcs({amdgcn_s_setreg})
1796 .Any({{_, _, S32}, {{}, {IntrId, Imm, SgprB32_ReadFirstLane}}});
1797
1798 addRulesForIOpcs({amdgcn_s_sendmsg, amdgcn_s_sendmsghalt})
1799 .Any({{}, {{}, {IntrId, Imm, SgprB32_M0}}});
1800
1801 addRulesForIOpcs({amdgcn_s_sendmsg_rtn})
1802 .Any({{S32}, {{Sgpr32}, {}}})
1803 .Any({{S64}, {{Sgpr64}, {}}});
1804
1805 addRulesForIOpcs({amdgcn_s_memrealtime, amdgcn_s_memtime}, Standard)
1806 .Uni(S64, {{Sgpr64}, {IntrId}});
1807
1808 addRulesForIOpcs({amdgcn_groupstaticsize, amdgcn_pops_exiting_wave_id,
1809 amdgcn_reloc_constant, amdgcn_s_get_waveid_in_workgroup},
1810 Standard)
1811 .Uni(S32, {{Sgpr32}, {IntrId}});
1812
1813 // Intrinsics with no register operands.
1814 addRulesForIOpcs({amdgcn_asyncmark,
1815 amdgcn_endpgm,
1816 amdgcn_iglp_opt,
1817 amdgcn_init_exec,
1818 amdgcn_s_barrier,
1819 amdgcn_s_barrier_leave,
1820 amdgcn_s_barrier_signal,
1821 amdgcn_s_barrier_wait,
1822 amdgcn_s_decperflevel,
1823 amdgcn_s_incperflevel,
1824 amdgcn_s_monitor_sleep,
1825 amdgcn_s_nop,
1826 amdgcn_s_sethalt,
1827 amdgcn_s_setprio,
1828 amdgcn_s_setprio_inc_wg,
1829 amdgcn_s_sleep,
1830 amdgcn_s_ttracedata_imm,
1831 amdgcn_s_wait_asynccnt,
1832 amdgcn_s_wait_bvhcnt,
1833 amdgcn_s_wait_dscnt,
1834 amdgcn_s_wait_event,
1835 amdgcn_s_wait_event_export_ready,
1836 amdgcn_s_wait_expcnt,
1837 amdgcn_s_wait_kmcnt,
1838 amdgcn_s_wait_loadcnt,
1839 amdgcn_s_wait_samplecnt,
1840 amdgcn_s_wait_storecnt,
1841 amdgcn_s_wait_tensorcnt,
1842 amdgcn_s_waitcnt,
1843 amdgcn_sched_barrier,
1844 amdgcn_sched_group_barrier,
1845 amdgcn_unreachable,
1846 amdgcn_wait_asyncmark,
1847 amdgcn_wave_barrier})
1848 .Any({{}, {{}, {}}});
1849
1850 addRulesForIOpcs({amdgcn_init_exec_from_input})
1851 .Any({{}, {{}, {IntrId, Sgpr32}}});
1852
1853 addRulesForIOpcs({amdgcn_s_ttracedata}).Any({{}, {{}, {IntrId, SgprB32_M0}}});
1854
1855 addRulesForIOpcs({amdgcn_s_sleep_var})
1856 .Any({{}, {{}, {IntrId, SgprB32_ReadFirstLane}}});
1857
1858 addRulesForIOpcs({amdgcn_s_barrier_join, amdgcn_s_wakeup_barrier})
1859 .Any({{}, {{}, {IntrId, SgprB32_M0}}});
1860
1861 addRulesForIOpcs({amdgcn_s_barrier_signal_var, amdgcn_s_barrier_init})
1862 .Any({{}, {{}, {IntrId, SgprB32_M0, SgprB32_M0}}});
1863
1864 addRulesForIOpcs({amdgcn_s_barrier_signal_isfirst})
1865 .Any({{UniS1}, {{Sgpr32Trunc}, {}}});
1866
1867 addRulesForIOpcs(
1868 {amdgcn_s_get_named_barrier_state, amdgcn_s_get_barrier_state}, Standard)
1869 .Uni(S32, {{Sgpr32}, {IntrId, SgprB32_M0}});
1870
1871 addRulesForIOpcs({amdgcn_flat_prefetch}).Any({{}, {{}, {IntrId, VgprP0}}});
1872
1873 addRulesForIOpcs({amdgcn_global_prefetch}).Any({{}, {{}, {IntrId, VgprP1}}});
1874
1875 addRulesForIOpcs({amdgcn_s_prefetch_data, amdgcn_s_prefetch_inst})
1877
1878 addRulesForIOpcs({amdgcn_class})
1879 .Any({{UniS1, _, S16}, {{UniInVcc}, {IntrId, Vgpr16, Vgpr32}}})
1880 .Any({{DivS1, _, S16}, {{Vcc}, {IntrId, Vgpr16, Vgpr32}}})
1881 .Any({{UniS1, _, S32}, {{UniInVcc}, {IntrId, Vgpr32, Vgpr32}}})
1882 .Any({{DivS1, _, S32}, {{Vcc}, {IntrId, Vgpr32, Vgpr32}}})
1883 .Any({{UniS1, _, S64}, {{UniInVcc}, {IntrId, Vgpr64, Vgpr32}}})
1884 .Any({{DivS1, _, S64}, {{Vcc}, {IntrId, Vgpr64, Vgpr32}}});
1885
1886 // This is "intrinsic lane mask" it was set to i32/i64 in llvm-ir.
1887 addRulesForIOpcs({amdgcn_end_cf})
1888 .Any({{_, UniS32}, {{}, {IntrId, Sgpr32}}})
1889 .Any({{_, UniS64}, {{}, {IntrId, Sgpr64}}});
1890
1891 addRulesForIOpcs({amdgcn_if_break}, Standard)
1892 .Uni(S64, {{Sgpr64}, {IntrId, Vcc, Sgpr64}})
1893 .Uni(S32, {{Sgpr32}, {IntrId, Vcc, Sgpr32}});
1894
1895 addRulesForIOpcs({amdgcn_exp})
1896 .Any({{_, _, _, S32, S32, S32, S32},
1897 {{}, {IntrId, Imm, Imm, Vgpr32, Vgpr32, Vgpr32, Vgpr32}}});
1898
1899 addRulesForIOpcs({amdgcn_exp_compr})
1900 .Any({{_, _, _, V2S16}, {{}, {IntrId, Imm, Imm, VgprV2S16, VgprV2S16}}});
1901
1902 addRulesForIOpcs({amdgcn_exp_row})
1903 .Any({{_, _, _, S32, S32, S32, S32, _, S32},
1904 {{},
1906 SgprB32_M0}}});
1907
1908 addRulesForIOpcs({amdgcn_lds_direct_load}, StandardB)
1909 .Div(B32, {{VgprB32}, {IntrId, SgprB32_M0}});
1910
1911 addRulesForIOpcs({amdgcn_lds_param_load}, Standard)
1912 .Div(S32, {{Vgpr32}, {IntrId, Imm, Imm, SgprB32_M0}});
1913
1914 addRulesForIOpcs({amdgcn_mbcnt_lo, amdgcn_mbcnt_hi}, Standard)
1915 .Div(S32, {{}, {Vgpr32, None, Vgpr32, Vgpr32}});
1916
1917 addRulesForIOpcs({amdgcn_readfirstlane})
1918 .Any({{UniB32, _, DivB32}, {{}, {SgprB32, None, VgprB32}}})
1919 // this should not exist in the first place, it is from call lowering
1920 // readfirstlaning just in case register is not in sgpr.
1921 .Any({{UniS32, _, UniS32}, {{}, {Sgpr32, None, Vgpr32}}});
1922
1923 addRulesForIOpcs({amdgcn_readlane}, StandardB)
1925
1926 addRulesForIOpcs({amdgcn_s_quadmask, amdgcn_s_wqm}, StandardB)
1928 .Uni(B64, {{SgprB64}, {IntrId, SgprB64_ReadFirstLane}});
1929
1930 addRulesForIOpcs({amdgcn_writelane}, StandardB)
1931 .Div(B32,
1932 {{VgprB32},
1934
1935 addRulesForIOpcs({amdgcn_add_max_i32, amdgcn_add_max_u32, amdgcn_add_min_i32,
1936 amdgcn_add_min_u32},
1937 Standard)
1938 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1939 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1940
1941 addRulesForIOpcs({amdgcn_pk_add_max_i16, amdgcn_pk_add_max_u16,
1942 amdgcn_pk_add_min_i16, amdgcn_pk_add_min_u16},
1943 Standard)
1946
1947 addRulesForIOpcs({amdgcn_permlane16, amdgcn_permlanex16}, StandardB)
1948 .Div(B32, {{VgprB32},
1951
1952 addRulesForIOpcs({amdgcn_permlane_bcast, amdgcn_permlane_up,
1953 amdgcn_permlane_down, amdgcn_permlane_xor},
1954 StandardB)
1955 .Div(B32,
1956 {{VgprB32},
1958
1959 addRulesForIOpcs({amdgcn_permlane_idx_gen}, Standard)
1961
1962 addRulesForIOpcs({amdgcn_perm}, Standard)
1963 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1964 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1965
1966 addRulesForIOpcs({amdgcn_lerp}, Standard)
1967 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1968 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1969
1970 addRulesForIOpcs(
1971 {amdgcn_msad_u8, amdgcn_sad_hi_u8, amdgcn_sad_u16, amdgcn_sad_u8},
1972 Standard)
1973 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1974 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1975
1976 addRulesForIOpcs(
1977 {amdgcn_wave_reduce_add, amdgcn_wave_reduce_and, amdgcn_wave_reduce_fadd,
1978 amdgcn_wave_reduce_fmax, amdgcn_wave_reduce_fmin,
1979 amdgcn_wave_reduce_fsub, amdgcn_wave_reduce_max, amdgcn_wave_reduce_min,
1980 amdgcn_wave_reduce_or, amdgcn_wave_reduce_sub, amdgcn_wave_reduce_umax,
1981 amdgcn_wave_reduce_umin, amdgcn_wave_reduce_xor},
1982 Standard)
1983 .Uni(S32, {{Sgpr32}, {IntrId, Sgpr32}})
1984 .Div(S32, {{Sgpr32ToVgprDst}, {IntrId, VgprB32}})
1985 .Uni(S64, {{Sgpr64}, {IntrId, Sgpr64}})
1986 .Div(S64, {{Sgpr64ToVgprDst}, {IntrId, VgprB64}});
1987
1988 addRulesForIOpcs({amdgcn_wave_shuffle}, Standard)
1989 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}})
1990 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
1991
1992 addRulesForIOpcs({amdgcn_bitop3, amdgcn_fmad_ftz}, Standard)
1993 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
1994 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
1995 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1996 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1997
1998 addRulesForIOpcs({amdgcn_udot4, amdgcn_sdot4, amdgcn_udot8, amdgcn_sdot8,
1999 amdgcn_dot4_f32_bf8_bf8, amdgcn_dot4_f32_bf8_fp8,
2000 amdgcn_dot4_f32_fp8_fp8, amdgcn_dot4_f32_fp8_bf8},
2001 Standard)
2002 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2003 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2004
2005 addRulesForIOpcs({amdgcn_rsq, amdgcn_rsq_clamp})
2006 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2007 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2008 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2009 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2010 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2011 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST)
2012 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2013 .Any({{UniS64}, {{UniInVgprS64}, {IntrId, Vgpr64}}})
2014 .Any({{DivS64}, {{Vgpr64}, {IntrId, Vgpr64}}});
2015
2016 addRulesForIOpcs({amdgcn_mul_u24, amdgcn_mul_i24}, Standard)
2017 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}})
2018 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}})
2019 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr32, Vgpr32}})
2020 .Div(S64, {{Vgpr64}, {IntrId, Vgpr32, Vgpr32}});
2021
2022 addRulesForIOpcs({amdgcn_ds_bpermute, amdgcn_ds_bpermute_fi_b32,
2023 amdgcn_ds_permute, amdgcn_fmul_legacy, amdgcn_mulhi_i24,
2024 amdgcn_mulhi_u24},
2025 Standard)
2026 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}})
2027 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
2028
2029 addRulesForIOpcs({amdgcn_cvt_sr_bf8_f32, amdgcn_cvt_sr_fp8_f32,
2030 amdgcn_cvt_sr_fp8_f32_e5m3, amdgcn_cvt_pk_bf8_f32,
2031 amdgcn_cvt_pk_fp8_f32, amdgcn_cvt_pk_fp8_f32_e5m3},
2032 Standard)
2033 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2034 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2035
2036 addRulesForIOpcs({amdgcn_cvt_off_f32_i4, amdgcn_cvt_f32_bf8,
2037 amdgcn_cvt_f32_fp8, amdgcn_cvt_f32_fp8_e5m3},
2038 Standard)
2039 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}})
2040 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}});
2041
2042 addRulesForIOpcs({amdgcn_cvt_pk_f32_bf8, amdgcn_cvt_pk_f32_fp8})
2043 .Any({{UniV2S32}, {{UniInVgprV2S32}, {IntrId, Vgpr32}}})
2044 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, Vgpr32}}});
2045
2046 addRulesForIOpcs({amdgcn_cvt_f16_bf8, amdgcn_cvt_f16_fp8}, Standard)
2047 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr32}})
2048 .Div(S16, {{Vgpr16}, {IntrId, Vgpr32}});
2049
2050 addRulesForIOpcs({amdgcn_cvt_pk_f16_bf8, amdgcn_cvt_pk_f16_fp8}, Standard)
2051 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr16}})
2052 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr16}});
2053
2054 addRulesForIOpcs({amdgcn_cvt_pk_bf8_f16, amdgcn_cvt_pk_fp8_f16}, Standard)
2055 .Uni(S16, {{UniInVgprS16}, {IntrId, VgprV2S16}})
2056 .Div(S16, {{Vgpr16}, {IntrId, VgprV2S16}});
2057
2058 addRulesForIOpcs({amdgcn_cvt_sr_bf8_f16, amdgcn_cvt_sr_fp8_f16}, Standard)
2059 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr16, Vgpr32, Vgpr32}})
2060 .Div(S32, {{Vgpr32}, {IntrId, Vgpr16, Vgpr32, Vgpr32}});
2061
2062 addRulesForIOpcs({amdgcn_cvt_sr_pk_f16_f32, amdgcn_cvt_sr_pk_bf16_f32},
2063 Standard)
2065 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2066
2067 addRulesForIOpcs(
2068 {amdgcn_cvt_scalef32_sr_fp8_f16, amdgcn_cvt_scalef32_sr_bf8_f16,
2069 amdgcn_cvt_scalef32_sr_fp8_bf16, amdgcn_cvt_scalef32_sr_bf8_bf16})
2070 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32, Vgpr16, Vgpr32, Vgpr32}}})
2071 .Any({{UniS32},
2073
2074 addRulesForIOpcs(
2075 {amdgcn_cvt_scalef32_sr_fp8_f32, amdgcn_cvt_scalef32_sr_bf8_f32})
2076 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vgpr32}}})
2077 .Any({{UniS32},
2079
2080 addRulesForIOpcs({amdgcn_cubesc, amdgcn_cubetc, amdgcn_cubema, amdgcn_cubeid,
2081 amdgcn_fma_legacy},
2082 Standard)
2083 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2084 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2085
2086 addRulesForIOpcs({amdgcn_frexp_mant, amdgcn_fract}, Standard)
2087 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16}})
2088 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16}})
2089 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}})
2090 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}})
2091 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64}})
2092 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64}});
2093
2094 addRulesForIOpcs({amdgcn_prng_b32})
2095 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}})
2096 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}});
2097
2098 addRulesForIOpcs({amdgcn_sffbh}, Standard)
2099 .Uni(S32, {{Sgpr32}, {IntrId, Sgpr32}})
2100 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}});
2101
2102 addRulesForIOpcs({amdgcn_ubfe, amdgcn_sbfe}, Standard)
2103 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2104 .Uni(S32, {{Sgpr32}, {IntrId, Sgpr32, Sgpr32, Sgpr32}, S_BFE})
2105 .Uni(S64, {{Sgpr64}, {IntrId, Sgpr64, Sgpr32, Sgpr32}, S_BFE})
2106 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr32, Vgpr32}, V_BFE});
2107
2108 addRulesForIOpcs({amdgcn_cvt_pk_i16, amdgcn_cvt_pk_u16, amdgcn_cvt_pknorm_i16,
2109 amdgcn_cvt_pknorm_u16},
2110 Standard)
2111 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr32, Vgpr32}})
2112 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32}});
2113
2114 addRulesForIOpcs({amdgcn_cvt_pkrtz}, Standard)
2115 .Uni(V2S16, {{SgprV2S16}, {IntrId, Sgpr32, Sgpr32}}, hasSALUFloat)
2116 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr32, Vgpr32}}, !hasSALUFloat)
2117 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32}});
2118
2119 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk32_bf6_f16,
2120 amdgcn_cvt_scalef32_sr_pk32_fp6_f16,
2121 amdgcn_cvt_scalef32_sr_pk32_bf6_bf16,
2122 amdgcn_cvt_scalef32_sr_pk32_fp6_bf16},
2123 Standard)
2125 .Any({{UniV6S32},
2127
2128 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk32_bf6_f32,
2129 amdgcn_cvt_scalef32_sr_pk32_fp6_f32},
2130 Standard)
2132 .Any({{UniV6S32},
2134
2135 addRulesForIOpcs(
2136 {amdgcn_cvt_scalef32_sr_pk_fp4_f16, amdgcn_cvt_scalef32_sr_pk_fp4_bf16},
2137 Standard)
2139 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, VgprV2S16, Vgpr32, Vgpr32}});
2140
2141 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk_fp4_f32}, Standard)
2143 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, VgprV2S32, Vgpr32, Vgpr32}});
2144
2145 addRulesForIOpcs(
2146 {amdgcn_cvt_scalef32_2xpk16_fp6_f32, amdgcn_cvt_scalef32_2xpk16_bf6_f32})
2147 .Any(
2149 .Any({{UniV6S32},
2151
2152 addRulesForIOpcs({amdgcn_cvt_scalef32_f16_fp8, amdgcn_cvt_scalef32_f16_bf8},
2153 Standard)
2154 .Div(V2S16, {{VgprV2S16}, {IntrId, VgprV2S16, Vgpr32, Vgpr32}})
2156
2157 addRulesForIOpcs({amdgcn_cvt_scalef32_f32_fp8, amdgcn_cvt_scalef32_f32_bf8},
2158 Standard)
2159 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}})
2160 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}});
2161
2162 addRulesForIOpcs(
2163 {amdgcn_cvt_scalef32_pk16_bf6_f16, amdgcn_cvt_scalef32_pk16_fp6_f16,
2164 amdgcn_cvt_scalef32_pk16_bf6_bf16, amdgcn_cvt_scalef32_pk16_fp6_bf16},
2165 Standard)
2168
2169 addRulesForIOpcs(
2170 {amdgcn_cvt_scalef32_pk16_bf6_f32, amdgcn_cvt_scalef32_pk16_fp6_f32},
2171 Standard)
2174
2175 addRulesForIOpcs(
2176 {amdgcn_cvt_scalef32_pk8_bf8_f16, amdgcn_cvt_scalef32_pk8_fp8_f16,
2177 amdgcn_cvt_scalef32_pk8_bf8_bf16, amdgcn_cvt_scalef32_pk8_fp8_bf16},
2178 Standard)
2181
2182 addRulesForIOpcs(
2183 {amdgcn_cvt_scalef32_pk8_bf8_f32, amdgcn_cvt_scalef32_pk8_fp8_f32},
2184 Standard)
2187
2188 addRulesForIOpcs(
2189 {amdgcn_cvt_scalef32_pk8_fp4_f16, amdgcn_cvt_scalef32_pk8_fp4_bf16},
2190 Standard)
2191 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S16, Vgpr32}})
2192 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S16, Vgpr32}});
2193
2194 addRulesForIOpcs({amdgcn_cvt_scalef32_pk8_fp4_f32}, Standard)
2195 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S32, Vgpr32}})
2196 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S32, Vgpr32}});
2197
2198 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk16_bf6_f16,
2199 amdgcn_cvt_scalef32_sr_pk16_fp6_f16,
2200 amdgcn_cvt_scalef32_sr_pk16_bf6_bf16,
2201 amdgcn_cvt_scalef32_sr_pk16_fp6_bf16},
2202 Standard)
2204 .Any({{UniV3S32},
2206
2207 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk16_bf6_f32,
2208 amdgcn_cvt_scalef32_sr_pk16_fp6_f32},
2209 Standard)
2211 .Any({{UniV3S32},
2213
2214 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk8_bf8_f16,
2215 amdgcn_cvt_scalef32_sr_pk8_fp8_f16,
2216 amdgcn_cvt_scalef32_sr_pk8_bf8_bf16,
2217 amdgcn_cvt_scalef32_sr_pk8_fp8_bf16},
2218 Standard)
2220 .Any({{UniV2S32},
2222
2223 addRulesForIOpcs(
2224 {amdgcn_cvt_scalef32_sr_pk8_bf8_f32, amdgcn_cvt_scalef32_sr_pk8_fp8_f32},
2225 Standard)
2227 .Any({{UniV2S32},
2229
2230 addRulesForIOpcs(
2231 {amdgcn_cvt_scalef32_sr_pk8_fp4_f16, amdgcn_cvt_scalef32_sr_pk8_fp4_bf16},
2232 Standard)
2233 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S16, Vgpr32, Vgpr32}})
2234 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S16, Vgpr32, Vgpr32}});
2235
2236 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk8_fp4_f32}, Standard)
2237 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S32, Vgpr32, Vgpr32}})
2238 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S32, Vgpr32, Vgpr32}});
2239
2240 addRulesForIOpcs(
2241 {amdgcn_cvt_scale_pk16_f16_bf6, amdgcn_cvt_scale_pk16_f16_fp6,
2242 amdgcn_cvt_scale_pk16_bf16_bf6, amdgcn_cvt_scale_pk16_bf16_fp6},
2243 Standard)
2246
2247 addRulesForIOpcs(
2248 {amdgcn_cvt_scale_pk16_f32_bf6, amdgcn_cvt_scale_pk16_f32_fp6}, Standard)
2251
2252 addRulesForIOpcs({amdgcn_cvt_scale_pk8_f16_bf8, amdgcn_cvt_scale_pk8_f16_fp8,
2253 amdgcn_cvt_scale_pk8_bf16_bf8,
2254 amdgcn_cvt_scale_pk8_bf16_fp8},
2255 Standard)
2258
2259 addRulesForIOpcs(
2260 {amdgcn_cvt_scale_pk8_f16_fp4, amdgcn_cvt_scale_pk8_bf16_fp4}, Standard)
2261 .Any({{DivV8S16}, {{VgprV8S16}, {IntrId, Vgpr32, Vgpr32}}})
2263
2264 addRulesForIOpcs({amdgcn_cvt_scale_pk8_f32_bf8, amdgcn_cvt_scale_pk8_f32_fp8},
2265 Standard)
2268
2269 addRulesForIOpcs({amdgcn_cvt_scale_pk8_f32_fp4}, Standard)
2270 .Any({{DivV8S32}, {{VgprV8S32}, {IntrId, Vgpr32, Vgpr32}}})
2272
2273 addRulesForIOpcs(
2274 {amdgcn_cvt_scalef32_pk32_bf6_f16, amdgcn_cvt_scalef32_pk32_fp6_f16,
2275 amdgcn_cvt_scalef32_pk32_bf6_bf16, amdgcn_cvt_scalef32_pk32_fp6_bf16},
2276 Standard)
2279
2280 addRulesForIOpcs(
2281 {amdgcn_cvt_scalef32_pk32_bf6_f32, amdgcn_cvt_scalef32_pk32_fp6_f32},
2282 Standard)
2285
2286 addRulesForIOpcs(
2287 {amdgcn_cvt_scalef32_pk_fp8_f32, amdgcn_cvt_scalef32_pk_bf8_f32},
2288 Standard)
2290 .Uni(V2S16,
2292
2293 addRulesForIOpcs(
2294 {amdgcn_cvt_scalef32_pk_f32_fp8, amdgcn_cvt_scalef32_pk_f32_bf8},
2295 Standard)
2296 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, Vgpr32, Vgpr32}}})
2298
2299 addRulesForIOpcs(
2300 {amdgcn_cvt_scalef32_pk_fp8_f16, amdgcn_cvt_scalef32_pk_bf8_f16,
2301 amdgcn_cvt_scalef32_pk_fp8_bf16, amdgcn_cvt_scalef32_pk_bf8_bf16},
2302 Standard)
2305
2306 addRulesForIOpcs({amdgcn_cvt_scalef32_pk_f32_fp4}, Standard)
2307 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, Vgpr32, Vgpr32}}})
2309
2310 addRulesForIOpcs({amdgcn_cvt_scalef32_pk_fp4_f32}, Standard)
2311 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vgpr32}})
2312 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vgpr32}});
2313
2314 addRulesForIOpcs(
2315 {amdgcn_cvt_scalef32_pk_f16_fp4, amdgcn_cvt_scalef32_pk_f16_fp8,
2316 amdgcn_cvt_scalef32_pk_f16_bf8, amdgcn_cvt_scalef32_pk_bf16_fp4,
2317 amdgcn_cvt_scalef32_pk_bf16_fp8, amdgcn_cvt_scalef32_pk_bf16_bf8},
2318 Standard)
2319 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32}})
2320 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr32, Vgpr32}});
2321
2322 addRulesForIOpcs(
2323 {amdgcn_cvt_scalef32_pk32_f32_fp6, amdgcn_cvt_scalef32_pk32_f32_bf6},
2324 Standard)
2327
2328 addRulesForIOpcs(
2329 {amdgcn_cvt_scalef32_pk32_f16_fp6, amdgcn_cvt_scalef32_pk32_f16_bf6,
2330 amdgcn_cvt_scalef32_pk32_bf16_fp6, amdgcn_cvt_scalef32_pk32_bf16_bf6},
2331 Standard)
2334
2335 addRulesForIOpcs(
2336 {amdgcn_cvt_scalef32_pk_fp4_f16, amdgcn_cvt_scalef32_pk_fp4_bf16},
2337 Standard)
2338 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, VgprV2S16, Vgpr32}})
2339 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, VgprV2S16, Vgpr32}});
2340
2341 addRulesForIOpcs({amdgcn_global_load_tr_b64})
2342 .Any({{DivB64, _, UniP1}, {{VgprB64}, {IntrId, SgprP1}}})
2343 .Any({{DivB64, _, DivP1}, {{VgprB64}, {IntrId, VgprP1}}})
2344 .Any({{DivB32, _, UniP1}, {{VgprB32}, {IntrId, SgprP1}}})
2345 .Any({{DivB32, _, DivP1}, {{VgprB32}, {IntrId, VgprP1}}});
2346
2347 addRulesForIOpcs({amdgcn_global_load_tr_b128})
2348 .Any({{DivB64, _, UniP1}, {{VgprB64}, {IntrId, SgprP1}}})
2349 .Any({{DivB64, _, DivP1}, {{VgprB64}, {IntrId, VgprP1}}})
2350 .Any({{DivB128, _, UniP1}, {{VgprB128}, {IntrId, SgprP1}}})
2351 .Any({{DivB128, _, DivP1}, {{VgprB128}, {IntrId, VgprP1}}});
2352
2353 addRulesForIOpcs({amdgcn_global_load_tr4_b64})
2354 .Any({{DivV2S32, _, UniP1}, {{VgprV2S32}, {IntrId, SgprP1}}})
2355 .Any({{DivV2S32, _, DivP1}, {{VgprV2S32}, {IntrId, VgprP1}}});
2356
2357 addRulesForIOpcs({amdgcn_global_load_tr6_b96})
2358 .Any({{DivV3S32, _, UniP1}, {{VgprV3S32}, {IntrId, SgprP1}}})
2359 .Any({{DivV3S32, _, DivP1}, {{VgprV3S32}, {IntrId, VgprP1}}});
2360
2361 addRulesForIOpcs({amdgcn_ds_load_tr4_b64, amdgcn_ds_load_tr8_b64})
2362 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, VgprP3}}});
2363
2364 addRulesForIOpcs({amdgcn_ds_load_tr6_b96})
2365 .Any({{DivV3S32}, {{VgprV3S32}, {IntrId, VgprP3}}});
2366
2367 addRulesForIOpcs({amdgcn_ds_load_tr16_b128})
2368 .Any({{DivB128}, {{VgprB128}, {IntrId, VgprP3}}});
2369
2370 addRulesForIOpcs({amdgcn_global_atomic_ordered_add_b64})
2371 .Any({{DivS64}, {{Vgpr64}, {IntrId, VgprP1, Vgpr64}}});
2372
2373 addRulesForIOpcs(
2374 {amdgcn_global_atomic_fmin_num, amdgcn_global_atomic_fmax_num}, Standard)
2375 .Div(S32, {{Vgpr32}, {IntrId, VgprP1, Vgpr32}});
2376
2377 addRulesForIOpcs({amdgcn_flat_atomic_fmin_num, amdgcn_flat_atomic_fmax_num},
2378 Standard)
2379 .Div(S32, {{Vgpr32}, {IntrId, VgprP0, Vgpr32}});
2380
2381 addRulesForIOpcs({amdgcn_raw_buffer_load_lds})
2382 .Any({{_}, {{}, {IntrId, SgprV4S32, SgprP3, Imm, Vgpr32, Sgpr32}}});
2383
2384 addRulesForIOpcs({amdgcn_raw_buffer_load_async_lds})
2385 .Any({{_}, {{}, {IntrId, SgprV4S32, SgprB32_M0, Imm, Vgpr32, Sgpr32}}});
2386
2387 addRulesForIOpcs({amdgcn_struct_buffer_load_async_lds})
2388 .Any(
2389 {{_},
2391
2392 addRulesForIOpcs({amdgcn_struct_buffer_load_lds})
2393 .Any({{_},
2394 {{}, {IntrId, SgprV4S32, SgprP3, Imm, Vgpr32, Vgpr32, Sgpr32}}});
2395
2396 addRulesForIOpcs({amdgcn_raw_ptr_buffer_load_lds})
2397 .Any({{_}, {{}, {IntrId, SgprP8, SgprP3, Imm, Vgpr32, Sgpr32}}});
2398
2399 addRulesForIOpcs({amdgcn_raw_ptr_buffer_load_async_lds})
2400 .Any({{}, {{}, {IntrId, SgprP8, SgprB32_M0, Imm, VgprB32, SgprB32}}});
2401
2402 addRulesForIOpcs({amdgcn_struct_ptr_buffer_load_async_lds})
2403 .Any({{_},
2404 {{}, {IntrId, SgprP8, SgprB32_M0, Imm, Vgpr32, Vgpr32, Sgpr32}}});
2405
2406 addRulesForIOpcs({amdgcn_struct_ptr_buffer_load_lds})
2407 .Any({{_}, {{}, {IntrId, SgprP8, SgprP3, Imm, Vgpr32, Vgpr32, Sgpr32}}});
2408
2409 addRulesForIOpcs(
2410 {amdgcn_global_load_lds, amdgcn_load_to_lds, amdgcn_load_async_to_lds})
2411 .Any({{}, {{}, {IntrId, VgprP1, SgprB32_M0}}});
2412
2413 addRulesForIOpcs({amdgcn_global_load_async_to_lds_b8,
2414 amdgcn_global_load_async_to_lds_b32,
2415 amdgcn_global_load_async_to_lds_b64,
2416 amdgcn_global_load_async_to_lds_b128,
2417 amdgcn_global_store_async_from_lds_b8,
2418 amdgcn_global_store_async_from_lds_b32,
2419 amdgcn_global_store_async_from_lds_b64,
2420 amdgcn_global_store_async_from_lds_b128})
2421 .Any({{}, {{}, {IntrId, VgprP1, VgprP3}}});
2422
2423 addRulesForIOpcs({amdgcn_global_load_async_lds})
2424 .Any({{}, {{}, {IntrId, VgprP1, SgprB32_M0}}});
2425
2426 addRulesForIOpcs({amdgcn_tensor_load_to_lds, amdgcn_tensor_store_from_lds})
2427 .Any({{},
2428 {{},
2432
2433 addRulesForIOpcs({amdgcn_cluster_load_b32})
2435 .Any({{DivB32, _, UniP1}, {{VgprB32}, {IntrId, SgprP1, Imm, SgprB32_M0}}})
2436 .Any(
2437 {{DivB32, _, DivP1}, {{VgprB32}, {IntrId, VgprP1, Imm, SgprB32_M0}}});
2438
2439 addRulesForIOpcs({amdgcn_cluster_load_b64})
2441 .Any({{DivB64, _, UniP1}, {{VgprB64}, {IntrId, SgprP1, Imm, SgprB32_M0}}})
2442 .Any(
2443 {{DivB64, _, DivP1}, {{VgprB64}, {IntrId, VgprP1, Imm, SgprB32_M0}}});
2444
2445 addRulesForIOpcs({amdgcn_cluster_load_b128})
2447 .Any({{DivB128, _, UniP1},
2448 {{VgprB128}, {IntrId, SgprP1, Imm, SgprB32_M0}}})
2449 .Any({{DivB128, _, DivP1},
2450 {{VgprB128}, {IntrId, VgprP1, Imm, SgprB32_M0}}});
2451
2452 addRulesForIOpcs({amdgcn_cluster_load_async_to_lds_b8,
2453 amdgcn_cluster_load_async_to_lds_b32,
2454 amdgcn_cluster_load_async_to_lds_b64,
2455 amdgcn_cluster_load_async_to_lds_b128})
2456 .Any({{}, {{}, {IntrId, VgprP1, VgprP3, Imm, Imm, SgprB32_M0}}});
2457
2458 addRulesForIOpcs({amdgcn_perm_pk16_b4_u4}, StandardB)
2459 .Uni(B64, {{UniInVgprB64}, {IntrId, Vgpr32, Vgpr32, VgprV2S32}})
2460 .Div(B64, {{VgprB64}, {IntrId, Vgpr32, Vgpr32, VgprV2S32}});
2461
2462 addRulesForIOpcs({amdgcn_perm_pk16_b6_u4}, StandardB)
2464 .Div(B96, {{VgprB96}, {IntrId, Vgpr32, VgprB64, VgprV2S32}});
2465
2466 addRulesForIOpcs({amdgcn_perm_pk16_b8_u4}, StandardB)
2468 .Div(B128, {{VgprB128}, {IntrId, VgprB64, VgprB64, VgprV2S32}});
2469
2470 addRulesForIOpcs({amdgcn_wwm, amdgcn_strict_wwm, amdgcn_wqm, amdgcn_softwqm,
2471 amdgcn_strict_wqm},
2472 StandardB)
2473 .Div(B32, {{VgprB32}, {IntrId, VgprB32}})
2474 .Uni(B32, {{SgprB32}, {IntrId, SgprB32}})
2475 .Div(B64, {{VgprB64}, {IntrId, VgprB64}})
2476 .Uni(B64, {{SgprB64}, {IntrId, SgprB64}})
2477 .Div(B96, {{VgprB96}, {IntrId, VgprB96}})
2478 .Uni(B96, {{SgprB96}, {IntrId, SgprB96}})
2479 .Div(B128, {{VgprB128}, {IntrId, VgprB128}})
2480 .Uni(B128, {{SgprB128}, {IntrId, SgprB128}})
2481 .Any({{UniB256}, {{SgprB256}, {IntrId, SgprB256}}})
2482 .Any({{DivB256}, {{VgprB256}, {IntrId, VgprB256}}})
2483 .Any({{UniB512}, {{SgprB512}, {IntrId, SgprB512}}})
2484 .Any({{DivB512}, {{VgprB512}, {IntrId, VgprB512}}});
2485
2486 addRulesForIOpcs({amdgcn_init_whole_wave}).Any({{DivS1}, {{Vcc}, {IntrId}}});
2487
2488 addRulesForIOpcs({amdgcn_kill, amdgcn_wqm_demote})
2489 .Any({{}, {{}, {IntrId, Vcc}}});
2490
2491 addRulesForIOpcs({amdgcn_set_inactive}, StandardB)
2492 .Div(B32, {{VgprB32}, {IntrId, VgprB32, VgprB32}});
2493
2494 addRulesForIOpcs({amdgcn_set_inactive_chain_arg}, Standard)
2495 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
2496
2497 addRulesForIOpcs({amdgcn_cvt_sr_bf16_f32, amdgcn_cvt_sr_f16_f32}, Standard)
2498 .Div(V2S16, {{VgprV2S16}, {IntrId, VgprV2S16, Vgpr32, Vgpr32}});
2499
2500 addRulesForIOpcs({amdgcn_ballot}, Standard)
2501 .Uni(S64, {{Sgpr64}, {IntrId, Vcc}})
2502 .Uni(S32, {{Sgpr32}, {IntrId, Vcc}});
2503
2504 addRulesForIOpcs({amdgcn_inverse_ballot})
2505 .Any({{DivS1, _, S32}, {{Vcc}, {IntrId, SgprB32_ReadFirstLane}}})
2506 .Any({{DivS1, _, S64}, {{Vcc}, {IntrId, SgprB64_ReadFirstLane}}});
2507
2508 addRulesForIOpcs({amdgcn_live_mask, amdgcn_ps_live})
2509 .Any({{DivS1}, {{Vcc}, {}}});
2510
2511 addRulesForIOpcs({amdgcn_mov_dpp, amdgcn_mov_dpp8}, StandardB)
2512 .Div(B32, {{VgprB32}, {IntrId, VgprB32}})
2513 .Div(B64, {{VgprB64}, {IntrId, VgprB64}});
2514
2515 addRulesForIOpcs({amdgcn_update_dpp}, StandardB)
2516 .Div(B32, {{VgprB32}, {IntrId, VgprB32, VgprB32}})
2517 .Div(B64, {{VgprB64}, {IntrId, VgprB64, VgprB64}});
2518
2519 addRulesForIOpcs({amdgcn_sin, amdgcn_cos, amdgcn_tanh}, Standard)
2520 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16}})
2521 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16}})
2522 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}})
2523 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}});
2524
2525 addRulesForIOpcs({amdgcn_trig_preop}, Standard)
2526 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr32}})
2527 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr32}});
2528
2529 addRulesForIOpcs({amdgcn_exp2})
2530 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2531 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2532 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2533 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2534 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2535 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2536 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST);
2537
2538 addRulesForIOpcs({amdgcn_rcp, amdgcn_sqrt})
2539 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2540 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2541 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2542 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2543 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2544 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2545 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST)
2546 .Any({{DivS64}, {{Vgpr64}, {IntrId, Vgpr64}}})
2547 .Any({{UniS64}, {{UniInVgprS64}, {IntrId, Vgpr64}}});
2548
2549 addRulesForIOpcs({amdgcn_log})
2550 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2551 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2552 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2553 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2554 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2555 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2556 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST);
2557
2558 addRulesForIOpcs({amdgcn_ds_atomic_async_barrier_arrive_b64})
2559 .Any({{}, {{}, {IntrId, VgprP3}}});
2560
2561 addRulesForIOpcs({amdgcn_ds_atomic_barrier_arrive_rtn_b64}, Standard)
2562 .Div(S64, {{Vgpr64}, {IntrId, VgprP3, Vgpr64}});
2563
2564 addRulesForIOpcs({amdgcn_ds_add_gs_reg_rtn, amdgcn_ds_sub_gs_reg_rtn},
2565 Standard)
2566 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}})
2567 .Div(S64, {{Vgpr64}, {IntrId, Vgpr32}});
2568
2569 addRulesForIOpcs({amdgcn_ds_append, amdgcn_ds_consume}, Standard)
2570 .Uni(S32, {{UniInVgprS32}, {IntrId, SgprB32_M0}})
2571 .Div(S32, {{Vgpr32}, {IntrId, SgprB32_M0}});
2572
2573 addRulesForIOpcs(
2574 {amdgcn_ds_bvh_stack_rtn, amdgcn_ds_bvh_stack_push4_pop1_rtn}, Standard)
2575 .Div(S32, {{Vgpr32, Vgpr32}, {IntrId, Vgpr32, Vgpr32, VgprV4S32}});
2576
2577 addRulesForIOpcs({amdgcn_ds_bvh_stack_push8_pop1_rtn}, Standard)
2578 .Div(S32, {{Vgpr32, Vgpr32}, {IntrId, Vgpr32, Vgpr32, VgprV8S32}});
2579
2580 addRulesForIOpcs({amdgcn_ds_bvh_stack_push8_pop2_rtn}, Standard)
2581 .Div(S64, {{Vgpr64, Vgpr32}, {IntrId, Vgpr32, Vgpr32, VgprV8S32}});
2582
2583 addRulesForIOpcs({amdgcn_ds_gws_sema_p, amdgcn_ds_gws_sema_v,
2584 amdgcn_ds_gws_sema_release_all})
2585 .Any({{}, {{}, {IntrId, SgprB32_M0}}});
2586
2587 addRulesForIOpcs(
2588 {amdgcn_ds_gws_barrier, amdgcn_ds_gws_init, amdgcn_ds_gws_sema_br})
2589 .Any({{}, {{}, {IntrId, Vgpr32, SgprB32_M0}}});
2590
2591 addRulesForIOpcs({amdgcn_ds_ordered_add, amdgcn_ds_ordered_swap}, Standard)
2592 .Div(S32, {{Vgpr32}, {IntrId, SgprB32_M0, Vgpr32}});
2593
2594 addRulesForIOpcs({amdgcn_ds_swizzle}, Standard)
2595 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}})
2596 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}});
2597
2598 addRulesForIOpcs({amdgcn_permlane16_var, amdgcn_permlanex16_var}, Standard)
2599 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2600
2601 addRulesForIOpcs({amdgcn_permlane16_swap, amdgcn_permlane32_swap}, Standard)
2602 .Div(S32, {{Vgpr32, Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
2603
2604 addRulesForIOpcs({amdgcn_permlane64}, StandardB)
2605 .Div(B32, {{VgprB32}, {IntrId, VgprB32}});
2606
2607 addRulesForIOpcs({amdgcn_ds_read_tr4_b64, amdgcn_ds_read_tr8_b64})
2608 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, VgprP3}}});
2609
2610 addRulesForIOpcs({amdgcn_ds_read_tr6_b96})
2611 .Any({{DivV3S32}, {{VgprV3S32}, {IntrId, VgprP3}}});
2612
2613 addRulesForIOpcs({amdgcn_ds_read_tr16_b64})
2614 .Any({{DivV4S16}, {{VgprV4S16}, {IntrId, VgprP3}}});
2615
2616 addRulesForIOpcs({amdgcn_interp_p1}, Standard)
2617 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Imm, Imm, SgprB32_M0}});
2618
2619 addRulesForIOpcs({amdgcn_interp_p1_f16}, Standard)
2620 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Imm, Imm, Imm, SgprB32_M0}});
2621
2622 addRulesForIOpcs({amdgcn_interp_p2}, Standard)
2623 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Imm, Imm, SgprB32_M0}});
2624
2625 addRulesForIOpcs({amdgcn_interp_p2_f16}, Standard)
2626 .Div(S16,
2628
2629 addRulesForIOpcs({amdgcn_interp_mov}, Standard)
2630 .Div(S32, {{Vgpr32}, {IntrId, Imm, Imm, Imm, SgprB32_M0}});
2631
2632 addRulesForIOpcs({amdgcn_interp_inreg_p10, amdgcn_interp_inreg_p2,
2633 amdgcn_interp_inreg_p10_f16, amdgcn_interp_p10_rtz_f16},
2634 Standard)
2635 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2636 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2637
2638 addRulesForIOpcs({amdgcn_interp_inreg_p2_f16, amdgcn_interp_p2_rtz_f16},
2639 Standard)
2640 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2641 .Div(S16, {{Vgpr16}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2642
2643 addRulesForIOpcs({amdgcn_frexp_exp})
2644 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2645 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2646 .Any({{UniS32, _, S32}, {{UniInVgprS32}, {IntrId, Vgpr32}}})
2647 .Any({{DivS32, _, S32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2648 .Any({{UniS32, _, S64}, {{UniInVgprS32}, {IntrId, Vgpr64}}})
2649 .Any({{DivS32, _, S64}, {{Vgpr32}, {IntrId, Vgpr64}}});
2650
2651 addRulesForIOpcs({amdgcn_div_fmas}, Standard)
2652 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vcc}})
2653 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vcc}})
2654 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr64, Vgpr64, Vcc}})
2655 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr64, Vgpr64, Vcc}});
2656
2657 addRulesForIOpcs({amdgcn_div_fixup}, Standard)
2658 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
2659 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
2660 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2661 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2662 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr64, Vgpr64}})
2663 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr64, Vgpr64}});
2664
2665 addRulesForIOpcs({amdgcn_div_scale}, Standard)
2666 .Div(S32, {{Vgpr32, Vcc}, {IntrId, Vgpr32, Vgpr32}})
2667 .Uni(S32, {{UniInVgprS32, UniInVcc}, {IntrId, Vgpr32, Vgpr32}})
2668 .Div(S64, {{Vgpr64, Vcc}, {IntrId, Vgpr64, Vgpr64}})
2669 .Uni(S64, {{UniInVgprS64, UniInVcc}, {IntrId, Vgpr64, Vgpr64}});
2670
2671 addRulesForIOpcs({amdgcn_fdot2, amdgcn_sdot2, amdgcn_udot2}, Standard)
2673 .Div(S32, {{Vgpr32}, {IntrId, VgprV2S16, VgprV2S16, Vgpr32}});
2674
2675 addRulesForIOpcs({amdgcn_fdot2_f16_f16, amdgcn_fdot2_bf16_bf16}, Standard)
2677 .Div(S16, {{Vgpr16}, {IntrId, VgprV2S16, VgprV2S16, Vgpr16}});
2678
2679 addRulesForIOpcs({amdgcn_sudot4, amdgcn_sudot8}, Standard)
2680 .Uni(S32, {{UniInVgprS32}, {IntrId, Imm, Vgpr32, Imm, Vgpr32, Vgpr32}})
2681 .Div(S32, {{Vgpr32}, {IntrId, Imm, Vgpr32, Imm, Vgpr32, Vgpr32}});
2682
2683 addRulesForIOpcs({amdgcn_s_alloc_vgpr})
2685
2686 addRulesForIOpcs({amdgcn_sat_pk4_i4_i8, amdgcn_sat_pk4_u4_u8}, Standard)
2687 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr32}})
2688 .Div(S16, {{Vgpr16}, {IntrId, Vgpr32}});
2689
2690 bool HasGFX90AInsts = ST->hasGFX90AInsts();
2691
2692 // On gfx90a+ both AGPR-form and VGPR-form exists
2693 addRulesForIOpcs({amdgcn_mfma_f32_32x32x1f32, amdgcn_mfma_f32_16x16x1f32,
2694 amdgcn_mfma_f32_4x4x1f32, amdgcn_mfma_f32_32x32x2f32,
2695 amdgcn_mfma_f32_16x16x4f32, amdgcn_mfma_f32_32x32x4f16,
2696 amdgcn_mfma_f32_16x16x4f16, amdgcn_mfma_f32_4x4x4f16,
2697 amdgcn_mfma_f32_32x32x8f16, amdgcn_mfma_f32_16x16x16f16,
2698 amdgcn_mfma_i32_32x32x4i8, amdgcn_mfma_i32_16x16x4i8,
2699 amdgcn_mfma_i32_4x4x4i8, amdgcn_mfma_i32_32x32x8i8,
2700 amdgcn_mfma_i32_16x16x16i8, amdgcn_mfma_f32_32x32x2bf16,
2701 amdgcn_mfma_f32_16x16x2bf16, amdgcn_mfma_f32_4x4x2bf16,
2702 amdgcn_mfma_f32_32x32x4bf16, amdgcn_mfma_f32_16x16x8bf16})
2703 .Any({{DivAnyTy},
2705 !HasGFX90AInsts)
2706 .Any({{DivAnyTy},
2707 {{VgprOrAgprAnyTy},
2709 HasGFX90AInsts);
2710
2711 // gfx90a+ only MFMAs
2712 addRulesForIOpcs({
2713 amdgcn_mfma_f32_32x32x4bf16_1k,
2714 amdgcn_mfma_f32_16x16x4bf16_1k,
2715 amdgcn_mfma_f32_4x4x4bf16_1k,
2716 amdgcn_mfma_f32_32x32x8bf16_1k,
2717 amdgcn_mfma_f32_16x16x16bf16_1k,
2718 amdgcn_mfma_f64_16x16x4f64,
2719 amdgcn_mfma_f64_4x4x4f64,
2720 amdgcn_mfma_i32_16x16x32_i8,
2721 amdgcn_mfma_i32_32x32x16_i8,
2722 amdgcn_mfma_f32_16x16x8_xf32,
2723 amdgcn_mfma_f32_32x32x4_xf32,
2724 amdgcn_mfma_f32_16x16x32_bf8_bf8,
2725 amdgcn_mfma_f32_16x16x32_bf8_fp8,
2726 amdgcn_mfma_f32_16x16x32_fp8_bf8,
2727 amdgcn_mfma_f32_16x16x32_fp8_fp8,
2728 amdgcn_mfma_f32_32x32x16_bf8_bf8,
2729 amdgcn_mfma_f32_32x32x16_bf8_fp8,
2730 amdgcn_mfma_f32_32x32x16_fp8_bf8,
2731 amdgcn_mfma_f32_32x32x16_fp8_fp8,
2732 // gfx950
2733 amdgcn_mfma_f32_16x16x32_f16,
2734 amdgcn_mfma_f32_32x32x16_f16,
2735 amdgcn_mfma_i32_16x16x64_i8,
2736 amdgcn_mfma_i32_32x32x32_i8,
2737 amdgcn_mfma_f32_16x16x32_bf16,
2738 amdgcn_mfma_f32_32x32x16_bf16,
2739 })
2740 .Any({{DivAnyTy},
2741 {{VgprOrAgprAnyTy},
2743
2744 addRulesForIOpcs(
2745 {// gfx942+
2746 amdgcn_smfmac_f32_16x16x32_f16, amdgcn_smfmac_f32_32x32x16_f16,
2747 amdgcn_smfmac_f32_16x16x32_bf16, amdgcn_smfmac_f32_32x32x16_bf16,
2748 amdgcn_smfmac_i32_16x16x64_i8, amdgcn_smfmac_i32_32x32x32_i8,
2749 amdgcn_smfmac_f32_16x16x64_bf8_bf8, amdgcn_smfmac_f32_16x16x64_bf8_fp8,
2750 amdgcn_smfmac_f32_16x16x64_fp8_bf8, amdgcn_smfmac_f32_16x16x64_fp8_fp8,
2751 amdgcn_smfmac_f32_32x32x32_bf8_bf8, amdgcn_smfmac_f32_32x32x32_bf8_fp8,
2752 amdgcn_smfmac_f32_32x32x32_fp8_bf8, amdgcn_smfmac_f32_32x32x32_fp8_fp8,
2753 // gfx950+
2754 amdgcn_smfmac_f32_16x16x64_f16, amdgcn_smfmac_f32_32x32x32_f16,
2755 amdgcn_smfmac_f32_16x16x64_bf16, amdgcn_smfmac_f32_32x32x32_bf16,
2756 amdgcn_smfmac_i32_16x16x128_i8, amdgcn_smfmac_i32_32x32x64_i8,
2757 amdgcn_smfmac_f32_16x16x128_bf8_bf8, amdgcn_smfmac_f32_16x16x128_bf8_fp8,
2758 amdgcn_smfmac_f32_16x16x128_fp8_bf8, amdgcn_smfmac_f32_16x16x128_fp8_fp8,
2759 amdgcn_smfmac_f32_32x32x64_bf8_bf8, amdgcn_smfmac_f32_32x32x64_bf8_fp8,
2760 amdgcn_smfmac_f32_32x32x64_fp8_bf8, amdgcn_smfmac_f32_32x32x64_fp8_fp8})
2761 .Any({{DivAnyTy},
2762 {{VgprOrAgprAnyTy},
2764
2765 addRulesForIOpcs({amdgcn_mfma_scale_f32_32x32x64_f8f6f4,
2766 amdgcn_mfma_scale_f32_16x16x128_f8f6f4})
2767 .Any({{DivAnyTy},
2768 {{VgprOrAgprAnyTy},
2770 Vgpr32, Imm, Vgpr32}}});
2771
2772 // WMMA/SWMMAC intrinsics: all register operands map to VGPR.
2773 addRulesForIOpcs(
2774 {// WMMA GFX11+
2775 amdgcn_wmma_f32_16x16x16_f16, amdgcn_wmma_f32_16x16x16_bf16,
2776 amdgcn_wmma_f16_16x16x16_f16, amdgcn_wmma_bf16_16x16x16_bf16,
2777 amdgcn_wmma_f16_16x16x16_f16_tied, amdgcn_wmma_bf16_16x16x16_bf16_tied,
2778 amdgcn_wmma_i32_16x16x16_iu8, amdgcn_wmma_i32_16x16x16_iu4,
2779 // WMMA GFX12
2780 amdgcn_wmma_f32_16x16x16_fp8_fp8, amdgcn_wmma_f32_16x16x16_fp8_bf8,
2781 amdgcn_wmma_f32_16x16x16_bf8_fp8, amdgcn_wmma_f32_16x16x16_bf8_bf8,
2782 amdgcn_wmma_i32_16x16x32_iu4,
2783 // WMMA GFX1250
2784 amdgcn_wmma_f32_16x16x4_f32, amdgcn_wmma_f32_16x16x32_bf16,
2785 amdgcn_wmma_f32_16x16x32_f16, amdgcn_wmma_f16_16x16x32_f16,
2786 amdgcn_wmma_bf16_16x16x32_bf16, amdgcn_wmma_bf16f32_16x16x32_bf16,
2787 amdgcn_wmma_f32_16x16x64_fp8_fp8, amdgcn_wmma_f32_16x16x64_fp8_bf8,
2788 amdgcn_wmma_f32_16x16x64_bf8_fp8, amdgcn_wmma_f32_16x16x64_bf8_bf8,
2789 amdgcn_wmma_f16_16x16x64_fp8_fp8, amdgcn_wmma_f16_16x16x64_fp8_bf8,
2790 amdgcn_wmma_f16_16x16x64_bf8_fp8, amdgcn_wmma_f16_16x16x64_bf8_bf8,
2791 amdgcn_wmma_f16_16x16x128_fp8_fp8, amdgcn_wmma_f16_16x16x128_fp8_bf8,
2792 amdgcn_wmma_f16_16x16x128_bf8_fp8, amdgcn_wmma_f16_16x16x128_bf8_bf8,
2793 amdgcn_wmma_f32_16x16x128_fp8_fp8, amdgcn_wmma_f32_16x16x128_fp8_bf8,
2794 amdgcn_wmma_f32_16x16x128_bf8_fp8, amdgcn_wmma_f32_16x16x128_bf8_bf8,
2795 amdgcn_wmma_i32_16x16x64_iu8, amdgcn_wmma_f32_16x16x128_f8f6f4,
2796 amdgcn_wmma_scale_f32_16x16x128_f8f6f4,
2797 amdgcn_wmma_scale16_f32_16x16x128_f8f6f4, amdgcn_wmma_f32_32x16x128_f4,
2798 amdgcn_wmma_scale_f32_32x16x128_f4, amdgcn_wmma_scale16_f32_32x16x128_f4,
2799 // WMMA GFX1251
2800 amdgcn_wmma_f64_16x16x4_f64,
2801 // SWMMAC GFX12
2802 amdgcn_swmmac_f32_16x16x32_f16, amdgcn_swmmac_f32_16x16x32_bf16,
2803 amdgcn_swmmac_f16_16x16x32_f16, amdgcn_swmmac_bf16_16x16x32_bf16,
2804 amdgcn_swmmac_i32_16x16x32_iu8, amdgcn_swmmac_i32_16x16x32_iu4,
2805 amdgcn_swmmac_i32_16x16x64_iu4, amdgcn_swmmac_f32_16x16x32_fp8_fp8,
2806 amdgcn_swmmac_f32_16x16x32_fp8_bf8, amdgcn_swmmac_f32_16x16x32_bf8_fp8,
2807 amdgcn_swmmac_f32_16x16x32_bf8_bf8,
2808 // SWMMAC GFX1250
2809 amdgcn_swmmac_f32_16x16x64_f16, amdgcn_swmmac_f32_16x16x64_bf16,
2810 amdgcn_swmmac_f16_16x16x64_f16, amdgcn_swmmac_bf16_16x16x64_bf16,
2811 amdgcn_swmmac_bf16f32_16x16x64_bf16, amdgcn_swmmac_f32_16x16x128_fp8_fp8,
2812 amdgcn_swmmac_f32_16x16x128_fp8_bf8, amdgcn_swmmac_f32_16x16x128_bf8_fp8,
2813 amdgcn_swmmac_f32_16x16x128_bf8_bf8, amdgcn_swmmac_f16_16x16x128_fp8_fp8,
2814 amdgcn_swmmac_f16_16x16x128_fp8_bf8, amdgcn_swmmac_f16_16x16x128_bf8_fp8,
2815 amdgcn_swmmac_f16_16x16x128_bf8_bf8, amdgcn_swmmac_i32_16x16x128_iu8})
2816 .Any({{}, {{}, {}, ApplyAllVgpr}});
2817
2818} // end initialize rules
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
AMDGPU address space definition.
Contains the definition of a TargetInstrInfo class that is common to all AMD GPUs.
constexpr LLT S16
constexpr LLT S1
constexpr LLT V2S16
constexpr LLT S32
constexpr LLT V4S32
constexpr LLT V3S32
constexpr LLT S64
constexpr LLT V2S32
constexpr LLT S128
UniformityLLTOpPredicateID LLTToBId(LLT Ty)
bool matchUniformityAndLLT(Register Reg, UniformityLLTOpPredicateID UniID, const MachineUniformityInfo &MUI, const MachineRegisterInfo &MRI)
UniformityLLTOpPredicateID LLTToId(LLT Ty)
AMD GCN specific subclass of TargetSubtarget.
Declares convenience wrapper classes for interpreting MachineInstr instances as specific generic oper...
#define _
IRTranslator LLVM IR MI
Register Reg
Register const TargetRegisterInfo * TRI
Machine IR instance of the generic uniformity analysis.
bool operator()(const MachineInstr &MI) const
Predicate operator||(const Predicate &RHS) const
Predicate operator&&(const Predicate &RHS) const
Predicate(std::function< bool(const MachineInstr &)> Pred)
Predicate operator!() const
RegBankLegalizeRules(const GCNSubtarget &ST, MachineRegisterInfo &MRI)
const SetOfRulesForOpcode * getRulesForOpc(MachineInstr &MI) const
const RegBankLLTMapping * findMappingForMI(const MachineInstr &MI, const MachineRegisterInfo &MRI, const MachineUniformityInfo &MUI) const
void addFastRuleDivergent(UniformityLLTOpPredicateID Ty, RegBankLLTMapping RuleApplyIDs)
void addFastRuleUniform(UniformityLLTOpPredicateID Ty, RegBankLLTMapping RuleApplyIDs)
Predicate
This enumeration lists the possible predicates for CmpInst subclasses.
Definition InstrTypes.h:740
bool isSigned() const
Definition InstrTypes.h:993
bool isDivergentAtDef(ConstValueRefT V) const
Whether V is divergent at its definition.
bool isUniformAtDef(ConstValueRefT V) const
Whether V is uniform/non-divergent at its definition.
bool isEquality() const
Return true if this predicate is either EQ or NE.
static constexpr LLT scalar(unsigned SizeInBits)
Get a low-level scalar or aggregate "bag of bits".
bool isBFloat16() const
static constexpr LLT pointer(unsigned AddressSpace, unsigned SizeInBits)
Get a low-level pointer in the given address space.
constexpr TypeSize getSizeInBits() const
Returns the total size of the type. Must only be called on sized types.
static constexpr LLT fixed_vector(unsigned NumElements, unsigned ScalarSizeInBits)
Get a low-level fixed-width vector of some number of elements and element width.
TypeSize getValue() const
Representation of each machine instruction.
A description of a memory reference used in the backend.
LocationSize getSize() const
Return the size in bytes of the memory reference.
unsigned getAddrSpace() const
LLVM_ABI Align getAlign() const
Return the minimum known alignment in bytes of the actual memory reference.
MachineOperand class - Representation of each machine instruction operand.
bool isReg() const
isReg - Tests if this is a MO_Register operand.
Register getReg() const
getReg - Returns the register number.
MachineRegisterInfo - Keep track of information for virtual and physical registers,...
LLT getType(Register Reg) const
Get the low-level type of Reg or LLT{} if Reg is not a generic (target independent) virtual register.
const TargetRegisterInfo * getTargetRegisterInfo() const
Wrapper class representing virtual and physical registers.
Definition Register.h:20
This class consists of common code factored out of the SmallVector class to reduce code duplication b...
void append(ItTy in_start, ItTy in_end)
Add the specified range to the end of the SmallVector.
void swap(SmallVectorImpl &RHS)
void push_back(const T &Elt)
This is a 'vector' (really, a variable-sized array), optimized for the case when the array is small.
#define llvm_unreachable(msg)
Marks that the current location is not supposed to be reachable.
@ CONSTANT_ADDRESS_32BIT
Address space for 32-bit constant memory.
@ CONSTANT_ADDRESS
Address space for constant memory (VTX2).
bool isAnyPtr(LLT Ty, unsigned Width)
bool isUniformMMO(const MachineMemOperand *MMO)
This namespace contains an enum with a value for every intrinsic/builtin function known by LLVM.
This is an optimization pass for GlobalISel generic memory operations.
GenericUniformityInfo< MachineSSAContext > MachineUniformityInfo
static const MachineMemOperand::Flags MONoClobber
Mark the MMO of a uniform load if there are no potentially clobbering stores on any path from the sta...
Definition SIInstrInfo.h:46
decltype(auto) cast(const From &Val)
cast<X> - Return the argument parameter cast to the specified type.
Definition Casting.h:559
SmallVector< UniformityLLTOpPredicateID, 4 > OpUniformityAndTypes
PredicateMapping(std::initializer_list< UniformityLLTOpPredicateID > OpList, std::function< bool(const MachineInstr &)> TestFunc=nullptr)
bool match(const MachineInstr &MI, const MachineUniformityInfo &MUI, const MachineRegisterInfo &MRI) const
std::function< bool(const MachineInstr &)> TestFunc
RegBankLLTMapping(std::initializer_list< RegBankLLTMappingApplyID > DstOpMappingList, std::initializer_list< RegBankLLTMappingApplyID > SrcOpMappingList, LoweringMethodID LoweringMethod=DoNotLower)
SmallVector< RegBankLLTMappingApplyID, 2 > DstOpMapping
SmallVector< RegBankLLTMappingApplyID, 4 > SrcOpMapping
This struct is a compact representation of a valid (non-zero power of two) alignment.
Definition Alignment.h:39