LLVM 24.0.0git
AMDGPURegBankLegalizeRules.cpp
Go to the documentation of this file.
1//===-- AMDGPURegBankLegalizeRules.cpp ------------------------------------===//
2//
3// Part of the LLVM Project, under the Apache License v2.0 with LLVM Exceptions.
4// See https://llvm.org/LICENSE.txt for license information.
5// SPDX-License-Identifier: Apache-2.0 WITH LLVM-exception
6//
7//===----------------------------------------------------------------------===//
8//
9/// Definitions of RegBankLegalize Rules for all opcodes.
10/// Implementation of container for all the Rules and search.
11/// Fast search for most common case when Rule.Predicate checks LLT and
12/// uniformity of register in operand 0.
13//
14//===----------------------------------------------------------------------===//
15
17#include "AMDGPUInstrInfo.h"
18#include "GCNSubtarget.h"
21#include "llvm/IR/IntrinsicsAMDGPU.h"
23
24#define DEBUG_TYPE "amdgpu-reg-bank-legalize"
25
26using namespace llvm;
27using namespace AMDGPU;
28
29bool AMDGPU::isAnyPtr(LLT Ty, unsigned Width) {
30 return Ty.isPointer() && Ty.getSizeInBits() == Width;
31}
32
34 std::initializer_list<RegBankLLTMappingApplyID> DstOpMappingList,
35 std::initializer_list<RegBankLLTMappingApplyID> SrcOpMappingList,
37 : DstOpMapping(DstOpMappingList), SrcOpMapping(SrcOpMappingList),
39
41 std::initializer_list<UniformityLLTOpPredicateID> OpList,
42 std::function<bool(const MachineInstr &)> TestFunc)
44
46 const MachineUniformityInfo &MUI,
47 const MachineRegisterInfo &MRI) {
48 switch (UniID) {
49 case S1:
50 return MRI.getType(Reg) == LLT::scalar(1);
51 case S16:
52 return MRI.getType(Reg) == LLT::scalar(16);
53 case S32:
54 return MRI.getType(Reg) == LLT::scalar(32);
55 case S64:
56 return MRI.getType(Reg) == LLT::scalar(64);
57 case S128:
58 return MRI.getType(Reg) == LLT::scalar(128);
59 case P0:
60 return MRI.getType(Reg) == LLT::pointer(0, 64);
61 case P1:
62 return MRI.getType(Reg) == LLT::pointer(1, 64);
63 case P2:
64 return MRI.getType(Reg) == LLT::pointer(2, 32);
65 case P3:
66 return MRI.getType(Reg) == LLT::pointer(3, 32);
67 case P4:
68 return MRI.getType(Reg) == LLT::pointer(4, 64);
69 case P5:
70 return MRI.getType(Reg) == LLT::pointer(5, 32);
71 case P8:
72 return MRI.getType(Reg) == LLT::pointer(8, 128);
73 case Ptr32:
74 return isAnyPtr(MRI.getType(Reg), 32);
75 case Ptr64:
76 return isAnyPtr(MRI.getType(Reg), 64);
77 case Ptr128:
78 return isAnyPtr(MRI.getType(Reg), 128);
79 case V2S16:
80 return MRI.getType(Reg) == LLT::fixed_vector(2, 16);
81 case V2S32:
82 return MRI.getType(Reg) == LLT::fixed_vector(2, 32);
83 case V3S32:
84 return MRI.getType(Reg) == LLT::fixed_vector(3, 32);
85 case V4S32:
86 return MRI.getType(Reg) == LLT::fixed_vector(4, 32);
87 case B32:
88 return MRI.getType(Reg).getSizeInBits() == 32;
89 case B64:
90 return MRI.getType(Reg).getSizeInBits() == 64;
91 case B96:
92 return MRI.getType(Reg).getSizeInBits() == 96;
93 case B128:
94 return MRI.getType(Reg).getSizeInBits() == 128;
95 case B160:
96 return MRI.getType(Reg).getSizeInBits() == 160;
97 case B256:
98 return MRI.getType(Reg).getSizeInBits() == 256;
99 case B512:
100 return MRI.getType(Reg).getSizeInBits() == 512;
101 case DivAnyTy:
102 return MUI.isDivergentAtDef(Reg);
103 case UniS1:
104 return MRI.getType(Reg) == LLT::scalar(1) && MUI.isUniformAtDef(Reg);
105 case UniS16:
106 return MRI.getType(Reg) == LLT::scalar(16) && MUI.isUniformAtDef(Reg);
107 case UniS32:
108 return MRI.getType(Reg) == LLT::scalar(32) && MUI.isUniformAtDef(Reg);
109 case UniS64:
110 return MRI.getType(Reg) == LLT::scalar(64) && MUI.isUniformAtDef(Reg);
111 case UniS128:
112 return MRI.getType(Reg) == LLT::scalar(128) && MUI.isUniformAtDef(Reg);
113 case UniBF16:
114 return MRI.getType(Reg).isBFloat16() && MUI.isUniformAtDef(Reg);
115 case UniP0:
116 return MRI.getType(Reg) == LLT::pointer(0, 64) && MUI.isUniformAtDef(Reg);
117 case UniP1:
118 return MRI.getType(Reg) == LLT::pointer(1, 64) && MUI.isUniformAtDef(Reg);
119 case UniP2:
120 return MRI.getType(Reg) == LLT::pointer(2, 32) && MUI.isUniformAtDef(Reg);
121 case UniP3:
122 return MRI.getType(Reg) == LLT::pointer(3, 32) && MUI.isUniformAtDef(Reg);
123 case UniP4:
124 return MRI.getType(Reg) == LLT::pointer(4, 64) && MUI.isUniformAtDef(Reg);
125 case UniP5:
126 return MRI.getType(Reg) == LLT::pointer(5, 32) && MUI.isUniformAtDef(Reg);
127 case UniP6:
128 return MRI.getType(Reg) == LLT::pointer(6, 32) && MUI.isUniformAtDef(Reg);
129 case UniP8:
130 return MRI.getType(Reg) == LLT::pointer(8, 128) && MUI.isUniformAtDef(Reg);
131 case UniPtr32:
132 return isAnyPtr(MRI.getType(Reg), 32) && MUI.isUniformAtDef(Reg);
133 case UniPtr64:
134 return isAnyPtr(MRI.getType(Reg), 64) && MUI.isUniformAtDef(Reg);
135 case UniPtr128:
136 return isAnyPtr(MRI.getType(Reg), 128) && MUI.isUniformAtDef(Reg);
137 case UniV2S16:
138 return MRI.getType(Reg) == LLT::fixed_vector(2, 16) &&
139 MUI.isUniformAtDef(Reg);
140 case UniV2S32:
141 return MRI.getType(Reg) == LLT::fixed_vector(2, 32) &&
142 MUI.isUniformAtDef(Reg);
143 case UniV3S32:
144 return MRI.getType(Reg) == LLT::fixed_vector(3, 32) &&
145 MUI.isUniformAtDef(Reg);
146 case UniV4S32:
147 return MRI.getType(Reg) == LLT::fixed_vector(4, 32) &&
148 MUI.isUniformAtDef(Reg);
149 case UniV6S32:
150 return MRI.getType(Reg) == LLT::fixed_vector(6, 32) &&
151 MUI.isUniformAtDef(Reg);
152 case UniV8S16:
153 return MRI.getType(Reg) == LLT::fixed_vector(8, 16) &&
154 MUI.isUniformAtDef(Reg);
155 case UniV8S32:
156 return MRI.getType(Reg) == LLT::fixed_vector(8, 32) &&
157 MUI.isUniformAtDef(Reg);
158 case UniV16S16:
159 return MRI.getType(Reg) == LLT::fixed_vector(16, 16) &&
160 MUI.isUniformAtDef(Reg);
161 case UniV16S32:
162 return MRI.getType(Reg) == LLT::fixed_vector(16, 32) &&
163 MUI.isUniformAtDef(Reg);
164 case UniV32S16:
165 return MRI.getType(Reg) == LLT::fixed_vector(32, 16) &&
166 MUI.isUniformAtDef(Reg);
167 case UniV32S32:
168 return MRI.getType(Reg) == LLT::fixed_vector(32, 32) &&
169 MUI.isUniformAtDef(Reg);
170 case UniV2S64:
171 return MRI.getType(Reg) == LLT::fixed_vector(2, 64) &&
172 MUI.isUniformAtDef(Reg);
173 case UniB32:
174 return MRI.getType(Reg).getSizeInBits() == 32 && MUI.isUniformAtDef(Reg);
175 case UniB64:
176 return MRI.getType(Reg).getSizeInBits() == 64 && MUI.isUniformAtDef(Reg);
177 case UniB96:
178 return MRI.getType(Reg).getSizeInBits() == 96 && MUI.isUniformAtDef(Reg);
179 case UniB128:
180 return MRI.getType(Reg).getSizeInBits() == 128 && MUI.isUniformAtDef(Reg);
181 case UniB160:
182 return MRI.getType(Reg).getSizeInBits() == 160 && MUI.isUniformAtDef(Reg);
183 case UniB256:
184 return MRI.getType(Reg).getSizeInBits() == 256 && MUI.isUniformAtDef(Reg);
185 case UniB512:
186 return MRI.getType(Reg).getSizeInBits() == 512 && MUI.isUniformAtDef(Reg);
187 case UniBRC: {
188 if (MUI.isDivergentAtDef(Reg))
189 return false;
190 // Check if there is SGPR register class of same size as the LLT.
191 const SIRegisterInfo *TRI =
192 static_cast<const SIRegisterInfo *>(MRI.getTargetRegisterInfo());
193 // There is no 16 bit SGPR register class. Extra size check is required
194 // since getSGPRClassForBitWidth returns SReg_32RegClass for Size 16.
195 unsigned LLTSize = MRI.getType(Reg).getSizeInBits();
196 return LLTSize >= 32 && TRI->getSGPRClassForBitWidth(LLTSize);
197 }
198 case DivS1:
199 return MRI.getType(Reg) == LLT::scalar(1) && MUI.isDivergentAtDef(Reg);
200 case DivS16:
201 return MRI.getType(Reg) == LLT::scalar(16) && MUI.isDivergentAtDef(Reg);
202 case DivS32:
203 return MRI.getType(Reg) == LLT::scalar(32) && MUI.isDivergentAtDef(Reg);
204 case DivS64:
205 return MRI.getType(Reg) == LLT::scalar(64) && MUI.isDivergentAtDef(Reg);
206 case DivS128:
207 return MRI.getType(Reg) == LLT::scalar(128) && MUI.isDivergentAtDef(Reg);
208 case DivP0:
209 return MRI.getType(Reg) == LLT::pointer(0, 64) && MUI.isDivergentAtDef(Reg);
210 case DivP1:
211 return MRI.getType(Reg) == LLT::pointer(1, 64) && MUI.isDivergentAtDef(Reg);
212 case DivP2:
213 return MRI.getType(Reg) == LLT::pointer(2, 32) && MUI.isDivergentAtDef(Reg);
214 case DivP3:
215 return MRI.getType(Reg) == LLT::pointer(3, 32) && MUI.isDivergentAtDef(Reg);
216 case DivP4:
217 return MRI.getType(Reg) == LLT::pointer(4, 64) && MUI.isDivergentAtDef(Reg);
218 case DivP5:
219 return MRI.getType(Reg) == LLT::pointer(5, 32) && MUI.isDivergentAtDef(Reg);
220 case DivPtr32:
221 return isAnyPtr(MRI.getType(Reg), 32) && MUI.isDivergentAtDef(Reg);
222 case DivPtr64:
223 return isAnyPtr(MRI.getType(Reg), 64) && MUI.isDivergentAtDef(Reg);
224 case DivPtr128:
225 return isAnyPtr(MRI.getType(Reg), 128) && MUI.isDivergentAtDef(Reg);
226 case DivV2S16:
227 return MRI.getType(Reg) == LLT::fixed_vector(2, 16) &&
229 case DivV2S32:
230 return MRI.getType(Reg) == LLT::fixed_vector(2, 32) &&
232 case DivV4S32:
233 return MRI.getType(Reg) == LLT::fixed_vector(4, 32) &&
235 case DivV2S64:
236 return MRI.getType(Reg) == LLT::fixed_vector(2, 64) &&
238 case DivV3S32:
239 return MRI.getType(Reg) == LLT::fixed_vector(3, 32) &&
241 case DivV4S16:
242 return MRI.getType(Reg) == LLT::fixed_vector(4, 16) &&
244 case DivV8S16:
245 return MRI.getType(Reg) == LLT::fixed_vector(8, 16) &&
247 case DivV8S32:
248 return MRI.getType(Reg) == LLT::fixed_vector(8, 32) &&
250 case DivV16S16:
251 return MRI.getType(Reg) == LLT::fixed_vector(16, 16) &&
253 case DivV16S32:
254 return MRI.getType(Reg) == LLT::fixed_vector(16, 32) &&
256 case DivV6S32:
257 return MRI.getType(Reg) == LLT::fixed_vector(6, 32) &&
259 case DivV32S16:
260 return MRI.getType(Reg) == LLT::fixed_vector(32, 16) &&
262 case DivV32S32:
263 return MRI.getType(Reg) == LLT::fixed_vector(32, 32) &&
265 case DivB32:
266 return MRI.getType(Reg).getSizeInBits() == 32 && MUI.isDivergentAtDef(Reg);
267 case DivB64:
268 return MRI.getType(Reg).getSizeInBits() == 64 && MUI.isDivergentAtDef(Reg);
269 case DivB96:
270 return MRI.getType(Reg).getSizeInBits() == 96 && MUI.isDivergentAtDef(Reg);
271 case DivB128:
272 return MRI.getType(Reg).getSizeInBits() == 128 && MUI.isDivergentAtDef(Reg);
273 case DivB160:
274 return MRI.getType(Reg).getSizeInBits() == 160 && MUI.isDivergentAtDef(Reg);
275 case DivB256:
276 return MRI.getType(Reg).getSizeInBits() == 256 && MUI.isDivergentAtDef(Reg);
277 case DivB512:
278 return MRI.getType(Reg).getSizeInBits() == 512 && MUI.isDivergentAtDef(Reg);
279 case DivBRC: {
280 if (MUI.isUniformAtDef(Reg))
281 return false;
282 // Check if there is VGPR register class of same size as the LLT.
283 const SIRegisterInfo *TRI =
284 static_cast<const SIRegisterInfo *>(MRI.getTargetRegisterInfo());
285 return TRI->getSGPRClassForBitWidth(MRI.getType(Reg).getSizeInBits());
286 }
287 case BRC: {
288 // Check if there is SGPR and VGPR register class of same size as the LLT.
289 const SIRegisterInfo *TRI =
290 static_cast<const SIRegisterInfo *>(MRI.getTargetRegisterInfo());
291 unsigned LLTSize = MRI.getType(Reg).getSizeInBits();
292 return LLTSize >= 32 && TRI->getSGPRClassForBitWidth(LLTSize) &&
293 TRI->getVGPRClassForBitWidth(LLTSize);
294 }
295 case _:
296 return true;
297 default:
298 llvm_unreachable("missing matchUniformityAndLLT");
299 }
300}
301
303 const MachineUniformityInfo &MUI,
304 const MachineRegisterInfo &MRI) const {
305 // Check LLT signature.
306 for (unsigned i = 0; i < OpUniformityAndTypes.size(); ++i) {
307 const MachineOperand &MO = MI.getOperand(i);
308 if (OpUniformityAndTypes[i] == _) {
309 assert((!MI.getOperand(i).isReg() ||
310 !MI.getOperand(i).getReg().isVirtual()) &&
311 "_ is for non-register and physical register operands only");
312 continue;
313 }
314
315 // Remaining IDs check registers.
316 if (!MO.isReg())
317 return false;
318
319 if (!matchUniformityAndLLT(MO.getReg(), OpUniformityAndTypes[i], MUI, MRI))
320 return false;
321 }
322
323 // More complex check.
324 if (TestFunc)
325 return TestFunc(MI);
326
327 return true;
328}
329
331
333 : FastTypes(FastTypes) {}
334
336 if (Ty == LLT::scalar(16))
337 return S16;
338 if (Ty == LLT::scalar(32))
339 return S32;
340 if (Ty == LLT::scalar(64))
341 return S64;
342 if (Ty == LLT::fixed_vector(2, 16))
343 return V2S16;
344 if (Ty == LLT::fixed_vector(2, 32))
345 return V2S32;
346 if (Ty == LLT::fixed_vector(3, 32))
347 return V3S32;
348 if (Ty == LLT::fixed_vector(4, 32))
349 return V4S32;
350 return _;
351}
352
354 if (Ty == LLT::scalar(32) || Ty == LLT::fixed_vector(2, 16) ||
355 isAnyPtr(Ty, 32))
356 return B32;
357 if (Ty == LLT::scalar(64) || Ty == LLT::fixed_vector(2, 32) ||
358 Ty == LLT::fixed_vector(4, 16) || isAnyPtr(Ty, 64))
359 return B64;
360 if (Ty == LLT::fixed_vector(3, 32))
361 return B96;
362 if (Ty == LLT::fixed_vector(4, 32) || Ty == LLT::fixed_vector(2, 64) ||
363 Ty == LLT::fixed_vector(8, 16) || isAnyPtr(Ty, 128))
364 return B128;
365 return _;
366}
367
368const RegBankLLTMapping *
370 const MachineRegisterInfo &MRI,
371 const MachineUniformityInfo &MUI) const {
372 // Search in "Fast Rules".
373 // Note: if fast rules are enabled, RegBankLLTMapping must be added in each
374 // slot that could "match fast Predicate". If not, InvalidMapping is
375 // returned which results in failure, does not search "Slow Rules".
376 if (FastTypes != NoFastRules) {
377 Register Reg = MI.getOperand(0).getReg();
378 int Slot;
379 if (FastTypes == StandardB)
380 Slot = getFastPredicateSlot(LLTToBId(MRI.getType(Reg)));
381 else
382 Slot = getFastPredicateSlot(LLTToId(MRI.getType(Reg)));
383
384 if (Slot != -1)
385 return MUI.isUniformAtDef(Reg) ? &Uni[Slot] : &Div[Slot];
386 }
387
388 // Slow search for more complex rules.
389 for (const RegBankLegalizeRule &Rule : Rules) {
390 if (Rule.Predicate.match(MI, MUI, MRI))
391 return &Rule.OperandMapping;
392 }
393
394 return nullptr;
395}
396
398 Rules.push_back(Rule);
399}
400
402 RegBankLLTMapping RuleApplyIDs) {
403 int Slot = getFastPredicateSlot(Ty);
404 assert(Slot != -1 && "Ty unsupported in this FastRulesTypes");
405 Div[Slot] = std::move(RuleApplyIDs);
406}
407
409 RegBankLLTMapping RuleApplyIDs) {
410 int Slot = getFastPredicateSlot(Ty);
411 assert(Slot != -1 && "Ty unsupported in this FastRulesTypes");
412 Uni[Slot] = std::move(RuleApplyIDs);
413}
414
415int SetOfRulesForOpcode::getFastPredicateSlot(
417 switch (FastTypes) {
418 case Standard: {
419 switch (Ty) {
420 case S32:
421 return 0;
422 case S16:
423 return 1;
424 case S64:
425 return 2;
426 case V2S16:
427 return 3;
428 default:
429 return -1;
430 }
431 }
432 case StandardB: {
433 switch (Ty) {
434 case B32:
435 return 0;
436 case B64:
437 return 1;
438 case B96:
439 return 2;
440 case B128:
441 return 3;
442 default:
443 return -1;
444 }
445 }
446 case Vector: {
447 switch (Ty) {
448 case S32:
449 return 0;
450 case V2S32:
451 return 1;
452 case V3S32:
453 return 2;
454 case V4S32:
455 return 3;
456 default:
457 return -1;
458 }
459 }
460 default:
461 return -1;
462 }
463}
464
465RegBankLegalizeRules::RuleSetInitializer
466RegBankLegalizeRules::addRulesForGOpcs(std::initializer_list<unsigned> OpcList,
467 FastRulesTypes FastTypes) {
468 return RuleSetInitializer(OpcList, GRulesAlias, GRules, FastTypes);
469}
470
471RegBankLegalizeRules::RuleSetInitializer
472RegBankLegalizeRules::addRulesForIOpcs(std::initializer_list<unsigned> OpcList,
473 FastRulesTypes FastTypes) {
474 return RuleSetInitializer(OpcList, IRulesAlias, IRules, FastTypes);
475}
476
479 unsigned Opc = MI.getOpcode();
480 if (Opc == AMDGPU::G_INTRINSIC || Opc == AMDGPU::G_INTRINSIC_CONVERGENT ||
481 Opc == AMDGPU::G_INTRINSIC_W_SIDE_EFFECTS ||
482 Opc == AMDGPU::G_INTRINSIC_CONVERGENT_W_SIDE_EFFECTS) {
483 unsigned IntrID = cast<GIntrinsic>(MI).getIntrinsicID();
484 auto IRAIt = IRulesAlias.find(IntrID);
485 if (IRAIt == IRulesAlias.end())
486 return nullptr;
487 return &IRules.at(IRAIt->second);
488 }
489
490 auto GRAIt = GRulesAlias.find(Opc);
491 if (GRAIt == GRulesAlias.end())
492 return nullptr;
493 return &GRules.at(GRAIt->second);
494}
495
496// Syntactic sugar wrapper for predicate lambda that enables '&&', '||' and '!'.
497class Predicate {
498private:
499 struct Elt {
500 // Save formula composed of Pred, '&&', '||' and '!' as a jump table.
501 // Sink ! to Pred. For example !((A && !B) || C) -> (!A || B) && !C
502 // Sequences of && and || will be represented by jumps, for example:
503 // (A && B && ... X) or (A && B && ... X) || Y
504 // A == true jump to B
505 // A == false jump to end or Y, result is A(false) or Y
506 // (A || B || ... X) or (A || B || ... X) && Y
507 // A == true jump to end or Y, result is A(true) or Y
508 // A == false jump to B
509 // Notice that when negating expression, we simply flip Neg on each Pred
510 // and swap TJumpOffset and FJumpOffset (&& becomes ||, || becomes &&).
511 std::function<bool(const MachineInstr &)> Pred;
512 bool Neg; // Neg of Pred is calculated before jump
513 unsigned TJumpOffset;
514 unsigned FJumpOffset;
515 };
516
517 SmallVector<Elt, 8> Expression;
518
519 Predicate(SmallVectorImpl<Elt> &&Expr) { Expression.swap(Expr); };
520
521public:
522 Predicate(std::function<bool(const MachineInstr &)> Pred) {
523 Expression.push_back({Pred, false, 1, 1});
524 };
525
526 bool operator()(const MachineInstr &MI) const {
527 unsigned Idx = 0;
528 unsigned ResultIdx = Expression.size();
529 bool Result;
530 do {
531 Result = Expression[Idx].Pred(MI);
532 Result = Expression[Idx].Neg ? !Result : Result;
533 if (Result) {
534 Idx += Expression[Idx].TJumpOffset;
535 } else {
536 Idx += Expression[Idx].FJumpOffset;
537 }
538 } while ((Idx != ResultIdx));
539
540 return Result;
541 };
542
543 Predicate operator!() const {
544 SmallVector<Elt, 8> NegExpression;
545 for (const Elt &ExprElt : Expression) {
546 NegExpression.push_back({ExprElt.Pred, !ExprElt.Neg, ExprElt.FJumpOffset,
547 ExprElt.TJumpOffset});
548 }
549 return Predicate(std::move(NegExpression));
550 };
551
552 Predicate operator&&(const Predicate &RHS) const {
553 SmallVector<Elt, 8> AndExpression = Expression;
554
555 unsigned RHSSize = RHS.Expression.size();
556 unsigned ResultIdx = Expression.size();
557 for (unsigned i = 0; i < ResultIdx; ++i) {
558 // LHS results in false, whole expression results in false.
559 if (i + AndExpression[i].FJumpOffset == ResultIdx)
560 AndExpression[i].FJumpOffset += RHSSize;
561 }
562
563 AndExpression.append(RHS.Expression);
564
565 return Predicate(std::move(AndExpression));
566 }
567
568 Predicate operator||(const Predicate &RHS) const {
569 SmallVector<Elt, 8> OrExpression = Expression;
570
571 unsigned RHSSize = RHS.Expression.size();
572 unsigned ResultIdx = Expression.size();
573 for (unsigned i = 0; i < ResultIdx; ++i) {
574 // LHS results in true, whole expression results in true.
575 if (i + OrExpression[i].TJumpOffset == ResultIdx)
576 OrExpression[i].TJumpOffset += RHSSize;
577 }
578
579 OrExpression.append(RHS.Expression);
580
581 return Predicate(std::move(OrExpression));
582 }
583};
584
585// Initialize rules
588 : ST(&_ST), MRI(&_MRI) {
589
590 addRulesForGOpcs({G_ADD, G_SUB}, Standard)
591 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32AExt, Sgpr32AExt}})
592 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
593 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
594 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
596 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
597 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr64}})
598 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
601
602 addRulesForGOpcs({G_UADDO, G_USUBO}, Standard)
603 .Uni(S32, {{Sgpr32, Sgpr32Trunc}, {Sgpr32, Sgpr32}})
604 .Div(S32, {{Vgpr32, Vcc}, {Vgpr32, Vgpr32}});
605
606 addRulesForGOpcs({G_UADDE, G_USUBE, G_SADDE, G_SSUBE}, Standard)
608 .Div(S32, {{Vgpr32, Vcc}, {Vgpr32, Vgpr32, Vcc}});
609
610 addRulesForGOpcs({G_UADDSAT, G_SADDSAT, G_USUBSAT, G_SSUBSAT}, Standard)
611 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}})
612 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
613 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}})
614 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
616 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}});
617
618 bool UseVecMulU64 = ST->useVMulU64Inst();
619 addRulesForGOpcs({G_MUL}, Standard)
620 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
621 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
622 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
623 .Uni(S64, {{SgprB64}, {SgprB64, SgprB64}})
625 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
626 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32AExt, Sgpr32AExt}})
627 .Div(S64, {{VgprB64}, {VgprB64, VgprB64}}, UseVecMulU64)
628 .Div(S64, {{VgprB64}, {VgprB64, VgprB64}, SplitTo32Mul}, !UseVecMulU64);
629
630 bool hasMulHi = ST->hasScalarMulHiInsts();
631 addRulesForGOpcs({G_UMULH, G_SMULH}, Standard)
632 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
633 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasMulHi)
634 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasMulHi);
635
636 addRulesForGOpcs({G_AMDGPU_MAD_U64_U32}, Standard)
637 .Div(S64, {{Vgpr64, Vcc}, {Vgpr32, Vgpr32, Vgpr64}})
639
640 bool HasScalarSMulU64 = ST->hasScalarSMulU64();
641 addRulesForGOpcs({G_AMDGPU_S_MUL_U64_U32, G_AMDGPU_S_MUL_I64_I32}, Standard)
642 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr64}, UniMul64}, HasScalarSMulU64)
643 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}, DivSMulToMAD});
644
645 addRulesForGOpcs({G_XOR, G_OR, G_AND}, StandardB)
647 .Any({{DivS1}, {{Vcc}, {Vcc, Vcc}}})
648 .Any({{UniS16}, {{Sgpr16}, {Sgpr16, Sgpr16}}})
649 .Any({{DivS16}, {{Vgpr16}, {Vgpr16, Vgpr16}}})
650 .Uni(B32, {{SgprB32}, {SgprB32, SgprB32}})
651 .Div(B32, {{VgprB32}, {VgprB32, VgprB32}})
652 .Uni(B64, {{SgprB64}, {SgprB64, SgprB64}})
653 .Div(B64, {{VgprB64}, {VgprB64, VgprB64}, SplitTo32});
654
655 addRulesForGOpcs({G_SHL}, Standard)
656 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32AExt, Sgpr32ZExt}})
657 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
659 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
660 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
661 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32}})
662 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
663 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
664
665 addRulesForGOpcs({G_LSHR}, Standard)
666 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32ZExt, Sgpr32ZExt}})
667 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
669 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
670 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
671 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32}})
672 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
673 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
674
675 addRulesForGOpcs({G_ASHR}, Standard)
676 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32SExt, Sgpr32ZExt}})
677 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
679 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
680 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
681 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32}})
682 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
683 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
684
685 addRulesForGOpcs({G_FSHR}, Standard)
686 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
687 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
688
689 addRulesForGOpcs({G_BSWAP}, Standard)
690 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
691 .Div(S16, {{Vgpr16}, {Vgpr16}})
692 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
693 .Div(S32, {{Vgpr32}, {Vgpr32}})
694 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16}})
695 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}});
696
697 addRulesForGOpcs({G_AMDGPU_CVT_F32_UBYTE0, G_AMDGPU_CVT_F32_UBYTE1,
698 G_AMDGPU_CVT_F32_UBYTE2, G_AMDGPU_CVT_F32_UBYTE3,
699 G_AMDGPU_RCP_IFLAG},
700 Standard)
701 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
702 .Div(S32, {{Vgpr32}, {Vgpr32}});
703
704 addRulesForGOpcs({G_FRAME_INDEX}).Any({{UniP5, _}, {{SgprP5}, {None}}});
705
706 addRulesForGOpcs({G_UBFX, G_SBFX}, Standard)
707 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32, Sgpr32}, S_BFE})
708 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}})
709 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32, Sgpr32}, S_BFE})
710 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32, Vgpr32}, V_BFE});
711
712 addRulesForGOpcs({G_SMIN, G_SMAX}, Standard)
713 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32SExt, Sgpr32SExt}})
714 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
715 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
716 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
718 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
719 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
720 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}});
721
722 addRulesForGOpcs({G_UMIN, G_UMAX}, Standard)
723 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32ZExt, Sgpr32ZExt}})
724 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
725 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
726 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
728 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
729 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
730 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}});
731
732 addRulesForGOpcs({G_IMPLICIT_DEF})
733 .Any({{UniS1}, {{Sgpr32Trunc}, {}}})
734 .Any({{UniS16}, {{Sgpr16}, {}}})
735 .Any({{UniBRC}, {{SgprBRC}, {}}});
736
737 addRulesForGOpcs({G_CONSTANT}, Standard)
738 .Any({{UniS1, _}, {{Sgpr32Trunc}, {}, UniCstExt}})
739 .Uni(S16, {{Sgpr16}, {}})
740 .Uni(S32, {{Sgpr32}, {}})
741 .Uni(S64, {{Sgpr64}, {}})
742 .Any({{UniPtr32, _}, {{SgprPtr32}, {}}})
743 .Any({{UniPtr64, _}, {{SgprPtr64}, {}}});
744
745 addRulesForGOpcs({G_FCONSTANT}, Standard)
746 .Uni(S16, {{Sgpr16}, {}})
747 .Uni(S32, {{Sgpr32}, {}})
748 .Uni(S64, {{Sgpr64}, {}});
749
750 addRulesForGOpcs({G_FREEZE})
751 .Any({{UniS1}, {{Sgpr32Trunc}, {Sgpr32AExt}}})
752 .Any({{DivS1}, {{Vcc}, {Vcc}}})
753 .Any({{UniS16}, {{Sgpr16}, {Sgpr16}}})
754 .Any({{UniBRC}, {{SgprBRC}, {SgprBRC}}})
755 .Any({{DivBRC}, {{VgprBRC}, {VgprBRC}}});
756
757 addRulesForGOpcs({G_BITCAST})
758 .Any({{UniS16}, {{Sgpr16}, {Sgpr16}}})
759 .Any({{DivS16}, {{Vgpr16}, {Vgpr16}}})
760 .Any({{UniBRC}, {{SgprBRC}, {SgprBRC}}})
761 .Any({{DivBRC}, {{VgprBRC}, {VgprBRC}}});
762
763 addRulesForGOpcs({G_UNMERGE_VALUES})
764 .Any({{UniS16}, {{}, {}, UnmergeToShiftTrunc}})
765 .Any({{UniBRC}, {{}, {}, VerifyAllSgpr}})
766 .Any({{DivBRC}, {{}, {}, ApplyAllVgpr}});
767
768 addRulesForGOpcs({G_BUILD_VECTOR, G_MERGE_VALUES})
769 .Any({{UniBRC, S16}, {{}, {}, VerifyAllSgpr}})
770 .Any({{UniBRC, BRC}, {{}, {}, VerifyAllSgpr}})
771 .Any({{DivBRC, S16}, {{}, {}, ApplyAllVgpr}})
772 .Any({{DivBRC, BRC}, {{}, {}, ApplyAllVgpr}});
773
774 addRulesForGOpcs({G_CONCAT_VECTORS})
775 .Any({{UniBRC, BRC}, {{}, {}, VerifyAllSgpr}})
776 .Any({{DivBRC, BRC}, {{}, {}, ApplyAllVgpr}});
777
778 addRulesForGOpcs({G_PHI})
779 .Any({{UniS1}, {{}, {}, AextToS32InIncomingBlockGPHI}})
780 .Any({{UniS16}, {{}, {}, VerifyAllSgprGPHI}})
781 .Any({{UniBRC}, {{}, {}, VerifyAllSgprGPHI}})
782 .Any({{DivBRC}, {{}, {}, VerifyAllSgprOrVgprGPHI}});
783
784 addRulesForGOpcs({G_EXTRACT_VECTOR_ELT})
785 .Any({{UniB32, UniBRC, UniS32}, {{SgprB32}, {SgprBRC, Sgpr32}}})
786 .Any({{DivB32, DivBRC, UniS32}, {{VgprB32}, {VgprBRC, Sgpr32}}})
787 .Any({{DivB32, BRC, DivS32},
789 .Any({{UniB64, UniBRC, UniS32}, {{SgprB64}, {SgprBRC, Sgpr32}}})
790 .Any({{DivB64, DivBRC, UniS32},
792 .Any({{DivB64, BRC, DivS32},
794
795 addRulesForGOpcs({G_INSERT_VECTOR_ELT})
797 {{SgprBRC}, {SgprBRC, SgprB32, Sgpr32}}})
798 .Any(
799 {{DivBRC, BRC, B32, UniS32}, {{VgprBRC}, {VgprBRC, VgprB32, Sgpr32}}})
800 .Any({{DivBRC, BRC, B32, DivS32},
804 .Any({{DivBRC, BRC, B64, UniS32},
806 .Any({{DivBRC, BRC, B64, DivS32},
808
809 // INTERSECT_RAY {Div}, {{VgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
810 // INTERSECT_RAY {Uni}, {{UniInVgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
811 addRulesForGOpcs({G_AMDGPU_BVH_INTERSECT_RAY, G_AMDGPU_BVH_DUAL_INTERSECT_RAY,
812 G_AMDGPU_BVH8_INTERSECT_RAY})
813 .Any({{}, {{}, {}, ApplyBVH_INTERSECT_RAY}});
814
815 // LOAD {Div}, {{VgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
816 // LOAD {Uni}, {{UniInVgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
817 // LOAD_NORET {}, {{}, {Imm, VgprSrc, ..., Sgpr_WF_RsrcIdx}}
818 // STORE {}, {{}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
819 addRulesForGOpcs({G_AMDGPU_INTRIN_IMAGE_LOAD, G_AMDGPU_INTRIN_IMAGE_LOAD_D16,
820 G_AMDGPU_INTRIN_IMAGE_LOAD_NORET,
821 G_AMDGPU_INTRIN_IMAGE_STORE,
822 G_AMDGPU_INTRIN_IMAGE_STORE_D16})
823 .Any({{}, {{}, {}, ApplyINTRIN_IMAGE}});
824
825 Predicate isSignedICmp([](const MachineInstr &MI) -> bool {
826 auto Pred =
827 static_cast<CmpInst::Predicate>(MI.getOperand(1).getPredicate());
828 return CmpInst::isSigned(Pred);
829 });
830
831 Predicate isEqualityICmp([](const MachineInstr &MI) -> bool {
832 auto Pred =
833 static_cast<CmpInst::Predicate>(MI.getOperand(1).getPredicate());
834 return ICmpInst::isEquality(Pred);
835 });
836
837 bool HasScalarCompareEq64 = ST->hasScalarCompareEq64();
838 // clang-format off
839 addRulesForGOpcs({G_ICMP})
840 .Any({{{UniS1, _, S16}, isEqualityICmp}, {{Sgpr32Trunc}, {None, Sgpr32ZExt, Sgpr32ZExt}}})
841 .Any({{{UniS1, _, S16}, !isEqualityICmp && isSignedICmp}, {{Sgpr32Trunc}, {None, Sgpr32SExt, Sgpr32SExt}}})
842 .Any({{{UniS1, _, S16}, !isEqualityICmp && !isSignedICmp}, {{Sgpr32Trunc}, {None, Sgpr32ZExt, Sgpr32ZExt}}})
843 .Any({{{DivS1, _, S16}}, {{Vcc}, {None, Vgpr16, Vgpr16}}})
844 .Any({{{UniS1, _, S32}}, {{Sgpr32Trunc}, {None, Sgpr32, Sgpr32}}})
845 .Any({{{DivS1, _, S32}}, {{Vcc}, {None, Vgpr32, Vgpr32}}})
846 .Any({{{UniS1, _, S64}, isEqualityICmp}, {{Sgpr32Trunc}, {None, Sgpr64, Sgpr64}}}, HasScalarCompareEq64)
847 .Any({{{UniS1, _, S64}, isEqualityICmp}, {{UniInVcc}, {None, Vgpr64, Vgpr64}}}, !HasScalarCompareEq64)
848 .Any({{{UniS1, _, S64}, !isEqualityICmp}, {{UniInVcc}, {None, Vgpr64, Vgpr64}}})
849 .Any({{{DivS1, _, S64}}, {{Vcc}, {None, Vgpr64, Vgpr64}}})
850 .Any({{{UniS1, _, Ptr32}}, {{Sgpr32Trunc}, {None, SgprPtr32, SgprPtr32}}})
851 .Any({{{DivS1, _, Ptr32}}, {{Vcc}, {None, VgprPtr32, VgprPtr32}}})
852 .Any({{{UniS1, _, Ptr64}, isEqualityICmp}, {{Sgpr32Trunc}, {None, SgprPtr64, SgprPtr64}}}, HasScalarCompareEq64)
853 .Any({{{UniS1, _, Ptr64}, isEqualityICmp}, {{UniInVcc}, {None, VgprPtr64, VgprPtr64}}}, !HasScalarCompareEq64)
854 .Any({{{UniS1, _, Ptr64}, !isEqualityICmp}, {{UniInVcc}, {None, VgprPtr64, VgprPtr64}}})
855 .Any({{{DivS1, _, Ptr64}}, {{Vcc}, {None, VgprPtr64, VgprPtr64}}});
856 // clang-format on
857
858 addRulesForGOpcs({G_BRCOND})
859 .Any({{UniS1}, {{}, {Sgpr32AExtBoolInReg}}})
860 .Any({{DivS1}, {{}, {Vcc}}});
861
862 addRulesForGOpcs({G_BR}).Any({{_}, {{}, {None}}});
863
864 addRulesForGOpcs({G_SELECT}, StandardB)
865 .Any({{DivS16}, {{Vgpr16}, {Vcc, Vgpr16, Vgpr16}}})
867 .Div(B32, {{VgprB32}, {Vcc, VgprB32, VgprB32}})
871
872 addRulesForGOpcs({G_ANYEXT})
873 .Any({{UniS16, S1}, {{None}, {None}}}) // should be combined away
874 .Any({{UniS32, S1}, {{None}, {None}}}) // should be combined away
875 .Any({{UniS64, S1}, {{None}, {None}}}) // should be combined away
876 .Any({{DivS16, S1}, {{Vgpr16}, {Vcc}, VccExtToSel}})
877 .Any({{DivS32, S1}, {{Vgpr32}, {Vcc}, VccExtToSel}})
878 .Any({{DivS64, S1}, {{Vgpr64}, {Vcc}, VccExtToSel}})
879 .Any({{UniS64, S32}, {{Sgpr64}, {Sgpr32}, Ext32To64}})
880 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}, Ext32To64}})
881 .Any({{UniS64, S16}, {{Sgpr64}, {Sgpr32AExt}, Ext32To64}})
882 .Any({{DivS64, S16}, {{Vgpr64}, {Vgpr32AExt}, Ext32To64}})
883 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}})
884 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}});
885
886 bool Has16bitCmp = ST->has16BitInsts();
887
888 // In global-isel G_TRUNC in-reg is treated as no-op, inst selected into COPY.
889 // It is up to user to deal with truncated bits.
890 // S1, S16, S32 and S64 results are handled with specific rules. Remaining
891 // (result, source) pairs with valid register classes are covered by the
892 // generic UniBRC/DivBRC wildcard rules.
893 addRulesForGOpcs({G_TRUNC})
894 .Any({{UniS1, UniS16}, {{None}, {None}}}) // should be combined away
895 .Any({{UniS1, UniS32}, {{None}, {None}}}) // should be combined away
896 .Any({{UniS1, UniS64}, {{None}, {None}}}) // should be combined away
897 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}})
898 .Any({{UniBRC, UniBRC}, {{SgprBRC}, {SgprBRC}}})
899 .Any({{DivBRC, DivBRC}, {{VgprBRC}, {VgprBRC}}})
900 .Any({{UniV2S16, V2S32}, {{SgprV2S16}, {SgprV2S32}}})
901 .Any({{DivV2S16, V2S32}, {{VgprV2S16}, {VgprV2S32}}})
902 // This is non-trivial. VgprToVccCopy is done using compare instruction.
903 .Any({{DivS1, DivS16}, {{Vcc}, {Vgpr16}, VgprToVccCopy}}, Has16bitCmp)
905 !Has16bitCmp)
906 .Any({{DivS1, DivS32}, {{Vcc}, {Vgpr32}, VgprToVccCopy}})
907 .Any({{DivS1, DivS64}, {{Vcc}, {Vgpr64}, VgprToVccCopy}});
908
909 addRulesForGOpcs({G_ZEXT})
913 .Any({{DivS16, S1}, {{Vgpr16}, {Vcc}, VccExtToSel}})
914 .Any({{DivS32, S1}, {{Vgpr32}, {Vcc}, VccExtToSel}})
915 .Any({{DivS64, S1}, {{Vgpr64}, {Vcc}, VccExtToSel}})
916 .Any({{UniS64, S32}, {{Sgpr64}, {Sgpr32}, Ext32To64}})
917 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}, Ext32To64}})
918 // not extending S16 to S32 is questionable.
919 .Any({{UniS64, S16}, {{Sgpr64}, {Sgpr32ZExt}, Ext32To64}})
920 .Any({{DivS64, S16}, {{Vgpr64}, {Vgpr32ZExt}, Ext32To64}})
921 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}})
922 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}});
923
924 addRulesForGOpcs({G_SEXT})
928 .Any({{DivS16, S1}, {{Vgpr16}, {Vcc}, VccExtToSel}})
929 .Any({{DivS32, S1}, {{Vgpr32}, {Vcc}, VccExtToSel}})
930 .Any({{DivS64, S1}, {{Vgpr64}, {Vcc}, VccExtToSel}})
931 .Any({{UniS64, S32}, {{Sgpr64}, {Sgpr32}, Ext32To64}})
932 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}, Ext32To64}})
933 // not extending S16 to S32 is questionable.
934 .Any({{UniS64, S16}, {{Sgpr64}, {Sgpr32SExt}, Ext32To64}})
935 .Any({{DivS64, S16}, {{Vgpr64}, {Vgpr32SExt}, Ext32To64}})
936 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}})
937 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}});
938
939 addRulesForGOpcs({G_SEXT_INREG})
940 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}})
941 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
942 .Any({{UniS64, S64}, {{Sgpr64}, {Sgpr64}}})
944
945 addRulesForGOpcs({G_ASSERT_ZEXT, G_ASSERT_SEXT}, Standard)
946 .Uni(S32, {{Sgpr32}, {Sgpr32, Imm}})
947 .Div(S32, {{Vgpr32}, {Vgpr32, Imm}})
948 .Uni(S64, {{Sgpr64}, {Sgpr64, Imm}})
949 .Div(S64, {{Vgpr64}, {Vgpr64, Imm}});
950
951 addRulesForGOpcs({G_ASSERT_ALIGN}, Standard)
952 .Uni(S32, {{Sgpr32}, {Sgpr32}})
953 .Div(S32, {{Vgpr32}, {Vgpr32}})
954 .Uni(S64, {{Sgpr64}, {Sgpr64}})
955 .Div(S64, {{Vgpr64}, {Vgpr64}})
956 .Any({{UniPtr32}, {{SgprPtr32}, {SgprPtr32}}})
957 .Any({{DivPtr32}, {{VgprPtr32}, {VgprPtr32}}})
958 .Any({{UniPtr64}, {{SgprPtr64}, {SgprPtr64}}})
959 .Any({{DivPtr64}, {{VgprPtr64}, {VgprPtr64}}});
960
961 // Atomic read-modify-write operations: result and value are always VGPR,
962 // pointer varies by address space.
963 addRulesForGOpcs({G_ATOMICRMW_ADD, G_ATOMICRMW_SUB, G_ATOMICRMW_XCHG,
964 G_ATOMICRMW_AND, G_ATOMICRMW_OR, G_ATOMICRMW_XOR,
965 G_ATOMICRMW_MIN, G_ATOMICRMW_MAX, G_ATOMICRMW_UMIN,
966 G_ATOMICRMW_UMAX, G_ATOMICRMW_UINC_WRAP,
967 G_ATOMICRMW_UDEC_WRAP, G_ATOMICRMW_FMIN, G_ATOMICRMW_FMAX})
968 .Any({{DivS32, P0, S32}, {{Vgpr32}, {VgprP0, Vgpr32}}})
969 .Any({{DivS64, P0, S64}, {{Vgpr64}, {VgprP0, Vgpr64}}})
970 .Any({{DivS32, P1, S32}, {{Vgpr32}, {VgprP1, Vgpr32}}})
971 .Any({{DivS64, P1, S64}, {{Vgpr64}, {VgprP1, Vgpr64}}})
972 .Any({{DivS32, P3, S32}, {{Vgpr32}, {VgprP3, Vgpr32}}})
973 .Any({{DivS64, P3, S64}, {{Vgpr64}, {VgprP3, Vgpr64}}});
974
975 addRulesForGOpcs({G_ATOMICRMW_USUB_SAT, G_ATOMICRMW_USUB_COND})
976 .Any({{DivS32, P0}, {{Vgpr32}, {VgprP0, Vgpr32}}})
977 .Any({{DivS32, P1}, {{Vgpr32}, {VgprP1, Vgpr32}}})
978 .Any({{DivS32, P3}, {{Vgpr32}, {VgprP3, Vgpr32}}});
979
980 bool HasAtomicFlatPkAdd16Insts = ST->hasAtomicFlatPkAdd16Insts();
981 bool HasAtomicBufferGlobalPkAddF16Insts =
982 ST->hasAtomicBufferGlobalPkAddF16NoRtnInsts() ||
983 ST->hasAtomicBufferGlobalPkAddF16Insts();
984 bool HasAtomicDsPkAdd16Insts = ST->hasAtomicDsPkAdd16Insts();
985 addRulesForGOpcs({G_ATOMICRMW_FADD})
986 .Any({{DivS32, P0, S32}, {{Vgpr32}, {VgprP0, Vgpr32}}})
987 .Any({{DivS64, P0, S64}, {{Vgpr64}, {VgprP0, Vgpr64}}})
988 .Any({{DivS32, P1, S32}, {{Vgpr32}, {VgprP1, Vgpr32}}})
989 .Any({{DivS64, P1, S64}, {{Vgpr64}, {VgprP1, Vgpr64}}})
990 .Any({{DivS32, P3, S32}, {{Vgpr32}, {VgprP3, Vgpr32}}})
991 .Any({{DivS64, P3, S64}, {{Vgpr64}, {VgprP3, Vgpr64}}})
992 .Any({{DivV2S16, P0, V2S16}, {{VgprV2S16}, {VgprP0, VgprV2S16}}},
993 HasAtomicFlatPkAdd16Insts)
994 .Any({{DivV2S16, P1, V2S16}, {{VgprV2S16}, {VgprP1, VgprV2S16}}},
995 HasAtomicBufferGlobalPkAddF16Insts)
996 .Any({{DivV2S16, P3, V2S16}, {{VgprV2S16}, {VgprP3, VgprV2S16}}},
997 HasAtomicDsPkAdd16Insts);
998
999 addRulesForGOpcs({G_ATOMIC_CMPXCHG})
1000 .Any({{DivS32, P2}, {{Vgpr32}, {VgprP2, Vgpr32, Vgpr32}}})
1001 .Any({{DivS64, P2}, {{Vgpr64}, {VgprP2, Vgpr64, Vgpr64}}})
1002 .Any({{DivS32, P3}, {{Vgpr32}, {VgprP3, Vgpr32, Vgpr32}}})
1003 .Any({{DivS64, P3}, {{Vgpr64}, {VgprP3, Vgpr64, Vgpr64}}});
1004
1005 addRulesForGOpcs({G_AMDGPU_ATOMIC_CMPXCHG})
1006 .Any({{DivS32, P0}, {{Vgpr32}, {VgprP0, VgprV2S32}}})
1007 .Any({{DivS32, P1}, {{Vgpr32}, {VgprP1, VgprV2S32}}})
1008 .Any({{DivS64, P0}, {{Vgpr64}, {VgprP0, VgprV2S64}}})
1009 .Any({{DivS64, P1}, {{Vgpr64}, {VgprP1, VgprV2S64}}});
1010
1011 addRulesForGOpcs({G_AMDGPU_BUFFER_ATOMIC_CMPSWAP}, Standard)
1012 .Div(S32, {{Vgpr32},
1014 .Div(S64, {{Vgpr64},
1016
1017 addRulesForGOpcs({G_AMDGPU_BUFFER_ATOMIC_ADD, G_AMDGPU_BUFFER_ATOMIC_AND,
1018 G_AMDGPU_BUFFER_ATOMIC_DEC, G_AMDGPU_BUFFER_ATOMIC_FMAX,
1019 G_AMDGPU_BUFFER_ATOMIC_FMIN, G_AMDGPU_BUFFER_ATOMIC_INC,
1020 G_AMDGPU_BUFFER_ATOMIC_OR, G_AMDGPU_BUFFER_ATOMIC_SMAX,
1021 G_AMDGPU_BUFFER_ATOMIC_SMIN, G_AMDGPU_BUFFER_ATOMIC_SUB,
1022 G_AMDGPU_BUFFER_ATOMIC_SWAP, G_AMDGPU_BUFFER_ATOMIC_UMAX,
1023 G_AMDGPU_BUFFER_ATOMIC_UMIN, G_AMDGPU_BUFFER_ATOMIC_XOR},
1024 Standard)
1027
1028 bool hasSMRDx3 = ST->hasScalarDwordx3Loads();
1029 bool hasSMRDSmall = ST->hasScalarSubwordLoads();
1030 bool usesTrue16 = ST->useRealTrue16Insts();
1031
1032 Predicate isAlign16([](const MachineInstr &MI) -> bool {
1033 return (*MI.memoperands_begin())->getAlign() >= Align(16);
1034 });
1035
1036 Predicate isAlign4([](const MachineInstr &MI) -> bool {
1037 return (*MI.memoperands_begin())->getAlign() >= Align(4);
1038 });
1039
1040 Predicate isAtomicMMO([](const MachineInstr &MI) -> bool {
1041 return (*MI.memoperands_begin())->isAtomic();
1042 });
1043
1044 Predicate isUniMMO([](const MachineInstr &MI) -> bool {
1045 return AMDGPU::isUniformMMO(*MI.memoperands_begin());
1046 });
1047
1048 Predicate isConst([](const MachineInstr &MI) -> bool {
1049 // Address space in MMO be different then address space on pointer.
1050 const MachineMemOperand *MMO = *MI.memoperands_begin();
1051 const unsigned AS = MMO->getAddrSpace();
1052 return AS == AMDGPUAS::CONSTANT_ADDRESS ||
1054 });
1055
1056 Predicate isVolatileMMO([](const MachineInstr &MI) -> bool {
1057 return (*MI.memoperands_begin())->isVolatile();
1058 });
1059
1060 Predicate isInvMMO([](const MachineInstr &MI) -> bool {
1061 return (*MI.memoperands_begin())->isInvariant();
1062 });
1063
1064 Predicate isNoClobberMMO([](const MachineInstr &MI) -> bool {
1065 return (*MI.memoperands_begin())->getFlags() & MONoClobber;
1066 });
1067
1068 Predicate isNaturalAligned([](const MachineInstr &MI) -> bool {
1069 const MachineMemOperand *MMO = *MI.memoperands_begin();
1070 return MMO->getAlign() >= Align(MMO->getSize().getValue());
1071 });
1072
1073 Predicate is8Or16BitMMO([](const MachineInstr &MI) -> bool {
1074 const MachineMemOperand *MMO = *MI.memoperands_begin();
1075 const unsigned MemSize = 8 * MMO->getSize().getValue();
1076 return MemSize == 16 || MemSize == 8;
1077 });
1078
1079 Predicate is32BitMMO([](const MachineInstr &MI) -> bool {
1080 const MachineMemOperand *MMO = *MI.memoperands_begin();
1081 return 8 * MMO->getSize().getValue() == 32;
1082 });
1083
1084 auto isUL = !isAtomicMMO && isUniMMO && (isConst || !isVolatileMMO) &&
1085 (isConst || isInvMMO || isNoClobberMMO);
1086
1087 // clang-format off
1088 // TODO: S32Dst, 16-bit any-extending load should not appear on True16 targets
1089 addRulesForGOpcs({G_LOAD})
1090 // flat, addrspace(0), never uniform - flat_load
1091 .Any({{DivS16, P0}, {{Vgpr16}, {VgprP0}}}, usesTrue16)
1092 .Any({{DivB32, P0}, {{VgprB32}, {VgprP0}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1093 .Any({{DivB64, P0}, {{VgprB64}, {VgprP0}}})
1094 .Any({{DivB96, P0}, {{VgprB96}, {VgprP0}}})
1095 .Any({{DivB128, P0}, {{VgprB128}, {VgprP0}}})
1096
1097 // global, addrspace(1)
1098 // divergent - global_load
1099 .Any({{DivS16, P1}, {{Vgpr16}, {VgprP1}}}, usesTrue16)
1100 .Any({{DivB32, P1}, {{VgprB32}, {VgprP1}}}) //32-bit load, 8-bit and 16-bit any-extending load
1101 .Any({{DivB64, P1}, {{VgprB64}, {VgprP1}}})
1102 .Any({{DivB96, P1}, {{VgprB96}, {VgprP1}}})
1103 .Any({{DivB128, P1}, {{VgprB128}, {VgprP1}}})
1104 .Any({{DivB256, P1}, {{VgprB256}, {VgprP1}, SplitLoad}})
1105 .Any({{DivB512, P1}, {{VgprB512}, {VgprP1}, SplitLoad}})
1106
1107 // uniform - s_load
1108 .Any({{{UniS16, P1}, isNaturalAligned && isUL}, {{Sgpr32Trunc}, {SgprP1}}}, usesTrue16 && hasSMRDSmall) // s16 load
1109 .Any({{{UniS16, P1}, isAlign4 && isUL}, {{Sgpr32Trunc}, {SgprP1}, WidenMMOToS32}}, usesTrue16 && !hasSMRDSmall) // s16 load to 32-bit load
1110 .Any({{{UniB32, P1}, isNaturalAligned && isUL}, {{SgprB32}, {SgprP1}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1111 // TODO: SplitLoad when !isNaturalAligned && isUL and target hasSMRDSmall
1112 .Any({{{UniB32, P1}, is8Or16BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP1}, WidenMMOToS32}}, !hasSMRDSmall) //8-bit and 16-bit any-extending load to 32-bit load
1113 .Any({{{UniB32, P1}, is32BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP1}}}) //32-bit load
1114 .Any({{{UniB64, P1}, isAlign4 && isUL}, {{SgprB64}, {SgprP1}}})
1115 .Any({{{UniB96, P1}, isAlign16 && isUL}, {{SgprB96}, {SgprP1}, WidenLoad}}, !hasSMRDx3)
1116 .Any({{{UniB96, P1}, isAlign4 && !isAlign16 && isUL}, {{SgprB96}, {SgprP1}, SplitLoad}}, !hasSMRDx3)
1117 .Any({{{UniB96, P1}, isAlign4 && isUL}, {{SgprB96}, {SgprP1}}}, hasSMRDx3)
1118 .Any({{{UniB128, P1}, isAlign4 && isUL}, {{SgprB128}, {SgprP1}}})
1119 .Any({{{UniB256, P1}, isAlign4 && isUL}, {{SgprB256}, {SgprP1}}})
1120 .Any({{{UniB512, P1}, isAlign4 && isUL}, {{SgprB512}, {SgprP1}}})
1121
1122 // Uniform via global or buffer load, for example volatile or non-aligned
1123 // uniform load. Not using standard {{UniInVgprTy}, {VgprP1}} since it is
1124 // selected as global_load, use SgprP1 for pointer instead to match
1125 // patterns without flat-for-global, default for GFX7 and older.
1126 // -> +flat-for-global + {{UniInVgprTy}, {SgprP1}} - global_load
1127 // -> -flat-for-global + {{UniInVgprTy}, {SgprP1}} - buffer_load
1128 .Any({{{UniS16, P1}, !isNaturalAligned || !isUL}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && hasSMRDSmall) // s16 load
1129 .Any({{{UniS16, P1}, !isAlign4 || !isUL}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && !hasSMRDSmall) // s16 load
1130 .Any({{{UniB32, P1}, !isNaturalAligned || !isUL}, {{UniInVgprB32}, {SgprP1}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1131 .Any({{{UniB32, P1}, !isAlign4 || !isUL}, {{UniInVgprB32}, {SgprP1}}}, !hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1132 .Any({{{UniB64, P1}, !isAlign4 || !isUL}, {{UniInVgprB64}, {SgprP1}}})
1133 .Any({{{UniB96, P1}, !isAlign4 || !isUL}, {{UniInVgprB96}, {SgprP1}}})
1134 .Any({{{UniB128, P1}, !isAlign4 || !isUL}, {{UniInVgprB128}, {SgprP1}}})
1135 .Any({{{UniB256, P1}, !isAlign4 || !isUL}, {{UniInVgprB256}, {SgprP1}, SplitLoad}})
1136 .Any({{{UniB512, P1}, !isAlign4 || !isUL}, {{UniInVgprB512}, {SgprP1}, SplitLoad}})
1137
1138 // local, addrspace(3) - ds_load
1139 .Any({{DivS16, P3}, {{Vgpr16}, {VgprP3}}}, usesTrue16)
1140 .Any({{DivB32, P3}, {{VgprB32}, {VgprP3}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1141 .Any({{DivB64, P3}, {{VgprB64}, {VgprP3}}})
1142 .Any({{DivB96, P3}, {{VgprB96}, {VgprP3}}})
1143 .Any({{DivB128, P3}, {{VgprB128}, {VgprP3}}})
1144
1145 .Any({{UniS16, P3}, {{UniInVgprS16}, {SgprP3}}}, usesTrue16) // 16-bit load
1146 .Any({{UniB32, P3}, {{UniInVgprB32}, {VgprP3}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1147 .Any({{UniB64, P3}, {{UniInVgprB64}, {VgprP3}}})
1148 .Any({{UniB96, P3}, {{UniInVgprB96}, {VgprP3}}})
1149 .Any({{UniB128, P3}, {{UniInVgprB128}, {VgprP3}}})
1150
1151 // constant, addrspace(4)
1152 // divergent - global_load
1153 .Any({{DivS16, P4}, {{Vgpr16}, {VgprP4}}}, usesTrue16)
1154 .Any({{DivB32, P4}, {{VgprB32}, {VgprP4}}}) //32-bit load, 8-bit and 16-bit any-extending load
1155 .Any({{DivB64, P4}, {{VgprB64}, {VgprP4}}})
1156 .Any({{DivB96, P4}, {{VgprB96}, {VgprP4}}})
1157 .Any({{DivB128, P4}, {{VgprB128}, {VgprP4}}})
1158 .Any({{DivB256, P4}, {{VgprB256}, {VgprP4}, SplitLoad}})
1159 .Any({{DivB512, P4}, {{VgprB512}, {VgprP4}, SplitLoad}})
1160
1161 // uniform - s_load
1162 .Any({{{UniS16, P4}, isNaturalAligned && isUL}, {{Sgpr32Trunc}, {SgprP4}}}, usesTrue16 && hasSMRDSmall) // s16 load
1163 .Any({{{UniS16, P4}, isAlign4 && isUL}, {{Sgpr32Trunc}, {SgprP4}, WidenMMOToS32}}, usesTrue16 && !hasSMRDSmall) // s16 load to 32-bit load
1164 .Any({{{UniB32, P4}, isNaturalAligned && isUL}, {{SgprB32}, {SgprP4}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1165 .Any({{{UniB32, P4}, is8Or16BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP4}, WidenMMOToS32}}, !hasSMRDSmall) //8-bit and 16-bit any-extending load to 32-bit load
1166 .Any({{{UniB32, P4}, is32BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP4}}}) //32-bit load
1167 .Any({{{UniB64, P4}, isAlign4 && isUL}, {{SgprB64}, {SgprP4}}})
1168 .Any({{{UniB96, P4}, isAlign16 && isUL}, {{SgprB96}, {SgprP4}, WidenLoad}}, !hasSMRDx3)
1169 .Any({{{UniB96, P4}, isAlign4 && !isAlign16 && isUL}, {{SgprB96}, {SgprP4}, SplitLoad}}, !hasSMRDx3)
1170 .Any({{{UniB96, P4}, isAlign4 && isUL}, {{SgprB96}, {SgprP4}}}, hasSMRDx3)
1171 .Any({{{UniB128, P4}, isAlign4 && isUL}, {{SgprB128}, {SgprP4}}})
1172 .Any({{{UniB256, P4}, isAlign4 && isUL}, {{SgprB256}, {SgprP4}}})
1173 .Any({{{UniB512, P4}, isAlign4 && isUL}, {{SgprB512}, {SgprP4}}})
1174
1175 // uniform in vgpr - global_load or buffer_load
1176 .Any({{{UniS16, P4}, !isNaturalAligned || !isUL}, {{UniInVgprS16}, {SgprP4}}}, usesTrue16 && hasSMRDSmall) // s16 load
1177 .Any({{{UniS16, P4}, !isAlign4 || !isUL}, {{UniInVgprS16}, {SgprP4}}}, usesTrue16 && !hasSMRDSmall) // s16 load
1178 .Any({{{UniB32, P4}, !isNaturalAligned || !isUL}, {{UniInVgprB32}, {SgprP4}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1179 .Any({{{UniB32, P4}, !isAlign4 || !isUL}, {{UniInVgprB32}, {SgprP4}}}, !hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1180 .Any({{{UniB64, P4}, !isAlign4 || !isUL}, {{UniInVgprB64}, {SgprP4}}})
1181 .Any({{{UniB96, P4}, !isAlign4 || !isUL}, {{UniInVgprB96}, {SgprP4}}})
1182 .Any({{{UniB128, P4}, !isAlign4 || !isUL}, {{UniInVgprB128}, {SgprP4}}})
1183 .Any({{{UniB256, P4}, !isAlign4 || !isUL}, {{UniInVgprB256}, {SgprP4}, SplitLoad}})
1184 .Any({{{UniB512, P4}, !isAlign4 || !isUL}, {{UniInVgprB512}, {SgprP4}, SplitLoad}})
1185
1186 // private, addrspace(5), never uniform - scratch_load
1187 .Any({{DivS16, P5}, {{Vgpr16}, {VgprP5}}}, usesTrue16)
1188 .Any({{DivB32, P5}, {{VgprB32}, {VgprP5}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1189 .Any({{DivB64, P5}, {{VgprB64}, {VgprP5}}})
1190 .Any({{DivB96, P5}, {{VgprB96}, {VgprP5}}})
1191 .Any({{DivB128, P5}, {{VgprB128}, {VgprP5}}})
1192
1193 .Any({{DivS32, Ptr128}, {{Vgpr32}, {VgprPtr128}}});
1194
1195
1196 addRulesForGOpcs({G_ZEXTLOAD, G_SEXTLOAD}) // i8 and i16 zeroextending loads
1197 .Any({{DivS32, P0}, {{Vgpr32}, {VgprP0}}})
1198 .Any({{DivS16, P0}, {{Vgpr16}, {VgprP0}}}, usesTrue16)
1199
1200 .Any({{DivS32, P1}, {{Vgpr32}, {VgprP1}}})
1201 .Any({{DivS16, P1}, {{Vgpr16}, {VgprP1}}}, usesTrue16)
1202 .Any({{{UniS16, P1}, isUL}, {{Sgpr32Trunc}, {SgprP1}}}, usesTrue16 && hasSMRDSmall)
1203 .Any({{{UniS16, P1}, !isUL}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && hasSMRDSmall)
1204 .Any({{UniS16, P1}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && !hasSMRDSmall)
1205 .Any({{{UniS32, P1}, isAlign4 && isUL}, {{Sgpr32}, {SgprP1}, WidenMMOToS32}}, !hasSMRDSmall)
1206 .Any({{{UniS32, P1}, isNaturalAligned && isUL}, {{Sgpr32}, {SgprP1}}}, hasSMRDSmall)
1207 .Any({{{UniS32, P1}, !isAlign4 || !isUL}, {{UniInVgprS32}, {SgprP1}}}, !hasSMRDSmall)
1208 .Any({{{UniS32, P1}, !isNaturalAligned || !isUL}, {{UniInVgprS32}, {SgprP1}}}, hasSMRDSmall)
1209
1210 .Any({{DivS32, P3}, {{Vgpr32}, {VgprP3}}})
1211 .Any({{DivS16, P3}, {{Vgpr16}, {VgprP3}}}, usesTrue16)
1212 .Any({{UniS16, P3}, {{UniInVgprS16}, {SgprP3}}}, usesTrue16)
1213 .Any({{UniS32, P3}, {{UniInVgprS32}, {VgprP3}}})
1214
1215 .Any({{DivS32, P4}, {{Vgpr32}, {VgprP4}}})
1216 .Any({{DivS16, P4}, {{Vgpr16}, {VgprP4}}}, usesTrue16)
1217 .Any({{{UniS16, P4}, isUL}, {{Sgpr32Trunc}, {SgprP4}}}, usesTrue16 && hasSMRDSmall)
1218 .Any({{UniS16, P4}, {{UniInVgprS16}, {SgprP4}}}, usesTrue16 && !hasSMRDSmall)
1219 .Any({{{UniS32, P4}, isAlign4 && isUL}, {{Sgpr32}, {SgprP4}, WidenMMOToS32}}, !hasSMRDSmall)
1220 .Any({{{UniS32, P4}, isNaturalAligned && isUL}, {{Sgpr32}, {SgprP4}}}, hasSMRDSmall)
1221 .Any({{{UniS32, P4}, !isAlign4 || !isUL}, {{UniInVgprS32}, {SgprP4}}}, !hasSMRDSmall)
1222 .Any({{{UniS32, P4}, !isNaturalAligned || !isUL}, {{UniInVgprS32}, {SgprP4}}}, hasSMRDSmall)
1223
1224 .Any({{DivS32, P5}, {{Vgpr32}, {VgprP5}}})
1225 .Any({{DivS16, P5}, {{Vgpr16}, {VgprP5}}}, usesTrue16);
1226
1227 addRulesForGOpcs({G_STORE})
1228 // addrspace(0)
1229 .Any({{S16, P0}, {{}, {Vgpr16, VgprP0}}}, usesTrue16) // 16-bit store
1230 .Any({{B32, P0}, {{}, {VgprB32, VgprP0}}}) // 32-bit store, 8-bit and 16-bit truncating store
1231 .Any({{B64, P0}, {{}, {VgprB64, VgprP0}}})
1232 .Any({{B96, P0}, {{}, {VgprB96, VgprP0}}})
1233 .Any({{B128, P0}, {{}, {VgprB128, VgprP0}}})
1234
1235 // addrspace(1), there are no stores to addrspace(4)
1236 // For targets:
1237 // - with "+flat-for-global" - global_store
1238 // - without(-flat-for-global) - buffer_store addr64
1239 .Any({{S16, DivP1}, {{}, {Vgpr16, VgprP1}}}, usesTrue16) // 16-bit store
1240 .Any({{B32, DivP1}, {{}, {VgprB32, VgprP1}}}) // 32-bit store, 8-bit and 16-bit truncating store
1241 .Any({{B64, DivP1}, {{}, {VgprB64, VgprP1}}})
1242 .Any({{B96, DivP1}, {{}, {VgprB96, VgprP1}}})
1243 .Any({{B128, DivP1}, {{}, {VgprB128, VgprP1}}})
1244
1245 // For UniP1, use sgpr ptr to match flat-for-global patterns. Targets:
1246 // - with "+flat-for-global" - global_store for both sgpr and vgpr ptr
1247 // - without(-flat-for-global) - need sgpr ptr to select buffer_store
1248 .Any({{S16, UniP1}, {{}, {Vgpr16, SgprP1}}}, usesTrue16) // 16-bit store
1249 .Any({{B32, UniP1}, {{}, {VgprB32, SgprP1}}}) // 32-bit store, 8-bit and 16-bit truncating store
1250 .Any({{B64, UniP1}, {{}, {VgprB64, SgprP1}}})
1251 .Any({{B96, UniP1}, {{}, {VgprB96, SgprP1}}})
1252 .Any({{B128, UniP1}, {{}, {VgprB128, SgprP1}}})
1253
1254 // addrspace(3) and addrspace(5)
1255 .Any({{S16, Ptr32}, {{}, {Vgpr16, VgprPtr32}}}, usesTrue16) // 16-bit store
1256 .Any({{B32, Ptr32}, {{}, {VgprB32, VgprPtr32}}}) // 32-bit store, 8-bit and 16-bit truncating store
1257 .Any({{B64, Ptr32}, {{}, {VgprB64, VgprPtr32}}})
1258 .Any({{B96, Ptr32}, {{}, {VgprB96, VgprPtr32}}})
1259 .Any({{B128, Ptr32}, {{}, {VgprB128, VgprPtr32}}});
1260
1261 // clang-format on
1262
1263 addRulesForGOpcs({G_AMDGPU_BUFFER_LOAD, G_AMDGPU_BUFFER_LOAD_FORMAT,
1264 G_AMDGPU_TBUFFER_LOAD_FORMAT},
1265 StandardB)
1274
1275 addRulesForGOpcs({G_AMDGPU_BUFFER_LOAD_USHORT, G_AMDGPU_BUFFER_LOAD_UBYTE,
1276 G_AMDGPU_BUFFER_LOAD_SSHORT, G_AMDGPU_BUFFER_LOAD_SBYTE},
1277 StandardB)
1280
1281 addRulesForGOpcs(
1282 {G_AMDGPU_BUFFER_LOAD_UBYTE_TFE, G_AMDGPU_BUFFER_LOAD_USHORT_TFE},
1283 StandardB)
1286
1287 addRulesForGOpcs({G_AMDGPU_BUFFER_LOAD_TFE, G_AMDGPU_BUFFER_LOAD_FORMAT_TFE,
1288 G_AMDGPU_BUFFER_LOAD_FORMAT_D16_TFE},
1289 StandardB)
1297 .Any({{UniB160},
1299
1300 addRulesForGOpcs(
1301 {G_AMDGPU_BUFFER_LOAD_FORMAT_D16, G_AMDGPU_TBUFFER_LOAD_FORMAT_D16},
1302 StandardB)
1309
1310 addRulesForGOpcs({G_AMDGPU_S_BUFFER_LOAD})
1311 // waterfall expansion is part of S_BUF_to_BUF
1312 .Any({{UniB32}, {{SgprB32}, {SgprV4S32, Sgpr32}}})
1313 .Any({{DivB32, UniV4S32, DivB32},
1315 .Any({{DivB32, DivV4S32, UniB32},
1317 .Any({{DivB32, DivV4S32, DivB32},
1319
1320 .Any({{UniB64}, {{SgprB64}, {SgprV4S32, Sgpr32}}})
1321 .Any({{DivB64, UniV4S32, DivB32},
1323 .Any({{DivB64, DivV4S32, UniB32},
1325 .Any({{DivB64, DivV4S32, DivB32},
1327
1328 .Any({{UniB96}, {{SgprB96}, {SgprV4S32, Sgpr32}}})
1329 .Any({{DivB96, UniV4S32, DivB32},
1331 .Any({{DivB96, DivV4S32, UniB32},
1333 .Any({{DivB96, DivV4S32, DivB32},
1335
1336 .Any({{UniB128}, {{SgprB128}, {SgprV4S32, Sgpr32}}})
1337 .Any({{DivB128, UniV4S32, DivB32},
1339 .Any({{DivB128, DivV4S32, UniB32},
1341 .Any({{DivB128, DivV4S32, DivB32},
1343
1344 .Any({{UniB256}, {{SgprB256}, {SgprV4S32, Sgpr32}}})
1345 .Any({{DivB256, UniV4S32, DivB32},
1347 .Any({{DivB256, DivV4S32, UniB32},
1349 .Any({{DivB256, DivV4S32, DivB32},
1351
1352 .Any({{UniB512}, {{SgprB512}, {SgprV4S32, Sgpr32}}})
1353 .Any({{DivB512, UniV4S32, DivB32},
1355 .Any({{DivB512, DivV4S32, UniB32},
1357 .Any({{DivB512, DivV4S32, DivB32},
1359
1360 addRulesForGOpcs({G_AMDGPU_S_BUFFER_LOAD_SBYTE, G_AMDGPU_S_BUFFER_LOAD_UBYTE,
1361 G_AMDGPU_S_BUFFER_LOAD_SSHORT,
1362 G_AMDGPU_S_BUFFER_LOAD_USHORT})
1364 .Any({{DivS32, UniV4S32, DivS32},
1366 .Any({{DivS32, DivV4S32, UniS32},
1368 .Any({{DivS32, DivV4S32, DivS32},
1370
1371 addRulesForGOpcs({G_AMDGPU_BUFFER_STORE, G_AMDGPU_BUFFER_STORE_BYTE,
1372 G_AMDGPU_BUFFER_STORE_SHORT, G_AMDGPU_BUFFER_STORE_FORMAT,
1373 G_AMDGPU_BUFFER_STORE_FORMAT_D16,
1374 G_AMDGPU_TBUFFER_STORE_FORMAT,
1375 G_AMDGPU_TBUFFER_STORE_FORMAT_D16})
1376 .Any({{B32}, {{}, {VgprB32, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}})
1377 .Any({{B64}, {{}, {VgprB64, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}})
1378 .Any({{B96}, {{}, {VgprB96, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}})
1379 .Any({{B128}, {{}, {VgprB128, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}});
1380
1381 // Buffer atomics: resource descriptor + scalar offset are SGPR, data and
1382 // address components are VGPR.
1383 //
1384 // Operand order (SIInstructions.td BufferAtomicGenericInstruction):
1385 // dst = op vdata, rsrc, vindex, voffset, soffset, offset_imm, cachepolicy,
1386 // idxen_imm
1387 addRulesForGOpcs({G_AMDGPU_BUFFER_ATOMIC_FADD})
1388 .Any({{S32, S32, V4S32, S32, S32, S32},
1390 .Any({{S64, S64, V4S32, S32, S32, S32},
1392 .Any({{V2S16, V2S16, V4S32, S32, S32, S32},
1393 {{VgprV2S16},
1395
1396 addRulesForGOpcs({G_PTR_ADD})
1397 .Any({{UniPtr32}, {{SgprPtr32}, {SgprPtr32, Sgpr32}}})
1398 .Any({{DivPtr32}, {{VgprPtr32}, {VgprPtr32, Vgpr32}}})
1399 .Any({{UniPtr64}, {{SgprPtr64}, {SgprPtr64, Sgpr64}}})
1400 .Any({{DivPtr64}, {{VgprPtr64}, {VgprPtr64, Vgpr64}}});
1401
1402 addRulesForGOpcs({G_INTTOPTR})
1403 .Any({{UniPtr32}, {{SgprPtr32}, {Sgpr32}}})
1404 .Any({{DivPtr32}, {{VgprPtr32}, {Vgpr32}}})
1405 .Any({{UniPtr64}, {{SgprPtr64}, {Sgpr64}}})
1406 .Any({{DivPtr64}, {{VgprPtr64}, {Vgpr64}}})
1407 .Any({{UniPtr128}, {{SgprPtr128}, {Sgpr128}}})
1408 .Any({{DivPtr128}, {{VgprPtr128}, {Vgpr128}}});
1409
1410 addRulesForGOpcs({G_PTRTOINT})
1411 .Any({{UniS32}, {{Sgpr32}, {SgprPtr32}}})
1412 .Any({{DivS32}, {{Vgpr32}, {VgprPtr32}}})
1413 .Any({{UniS64}, {{Sgpr64}, {SgprPtr64}}})
1414 .Any({{DivS64}, {{Vgpr64}, {VgprPtr64}}})
1415 .Any({{UniS128}, {{Sgpr128}, {SgprPtr128}}})
1416 .Any({{DivS128}, {{Vgpr128}, {VgprPtr128}}});
1417
1418 // FIXME: Update llvm/test/CodeGen/AMDGPU/ptrmask.ll to use GlobalISel.
1419 // Currently crashes on P8 (buffer resource) tests due to legalizer issue.
1420 addRulesForGOpcs({G_PTRMASK})
1421 .Any({{UniP1}, {{SgprP1}, {SgprP1, Sgpr64}}})
1422 .Any({{DivP1}, {{VgprP1}, {VgprP1, Vgpr64}}})
1423 .Any({{UniP3}, {{SgprP3}, {SgprP3, Sgpr32}}})
1424 .Any({{DivP3}, {{VgprP3}, {VgprP3, Vgpr32}}});
1425
1426 addRulesForGOpcs({G_DYN_STACKALLOC})
1427 .Any({{UniP5, UniS32}, {{SgprP5}, {Sgpr32}, DynStackAlloc}})
1428 .Any({{UniP5, DivS32}, {{SgprP5}, {Vgpr32}, DynStackAlloc}});
1429
1430 addRulesForGOpcs({G_ABS}, Standard)
1431 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32SExt}})
1432 .Div(S16, {{Vgpr16}, {Vgpr16}, AbsToNegMax})
1433 .Uni(S32, {{Sgpr32}, {Sgpr32}})
1434 .Div(S32, {{Vgpr32}, {Vgpr32}, AbsToNegMax})
1435 .Uni(V2S16, {{SgprV2S16}, {SgprV2S16}, AbsToS32})
1436 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}, AbsToNegMax});
1437
1438 addRulesForGOpcs({G_BITREVERSE}, Standard)
1439 .Uni(S32, {{Sgpr32}, {Sgpr32}})
1440 .Div(S32, {{Vgpr32}, {Vgpr32}})
1441 .Uni(S64, {{Sgpr64}, {Sgpr64}})
1442 .Div(S64, {{Vgpr64}, {Vgpr64}});
1443
1444 addRulesForGOpcs({G_AMDGPU_FFBH_U32, G_AMDGPU_FFBL_B32, G_CTLZ_ZERO_POISON,
1445 G_CTTZ_ZERO_POISON})
1446 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}})
1447 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1448 .Any({{UniS32, S64}, {{Sgpr32}, {Sgpr64}}})
1450
1451 addRulesForGOpcs({G_CTPOP})
1452 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}})
1453 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1454 .Any({{UniS32, S64}, {{Sgpr32}, {Sgpr64}}})
1455 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}, CtPop64To32}});
1456
1457 addRulesForGOpcs({G_FENCE}).Any({{{}}, {{}, {}}});
1458
1459 addRulesForGOpcs({G_READSTEADYCOUNTER, G_READCYCLECOUNTER}, Standard)
1460 .Uni(S64, {{Sgpr64}, {}});
1461
1462 addRulesForGOpcs({G_GET_ROUNDING}, Standard)
1463 .Uni(S32, {{Sgpr32}, {}, LowerGetRounding});
1464
1465 addRulesForGOpcs({G_SET_ROUNDING}, Standard)
1468
1469 addRulesForGOpcs({G_BLOCK_ADDR}).Any({{UniP0}, {{SgprP0}, {}}});
1470
1471 addRulesForGOpcs({G_GLOBAL_VALUE})
1472 .Any({{UniP0}, {{SgprP0}, {}}})
1473 .Any({{UniP1}, {{SgprP1}, {}}})
1474 .Any({{UniP3}, {{SgprP3}, {}}})
1475 .Any({{UniP4}, {{SgprP4}, {}}})
1476 .Any({{UniP8}, {{SgprP8}, {}}});
1477
1478 addRulesForGOpcs({G_AMDGPU_WAVE_ADDRESS}).Any({{UniP5}, {{SgprP5}, {}}});
1479
1480 addRulesForGOpcs({G_AMDGPU_SPONENTRY}, Standard).Uni(S32, {{Sgpr32}, {}});
1481
1482 addRulesForGOpcs({G_SI_CALL})
1483 .Any({{_, UniP0}, {{None}, {SgprP0}}})
1484 .Any({{_, DivP0}, {{None}, {SgprP0Call_WF}}})
1485 .Any({{_, UniP4}, {{None}, {SgprP4}}})
1486 .Any({{_, DivP4}, {{None}, {SgprP4Call_WF}}});
1487
1488 bool hasSALUFloat = ST->hasSALUFloatInsts();
1489
1490 addRulesForGOpcs({G_FADD, G_FMUL, G_STRICT_FADD, G_STRICT_FMUL}, Standard)
1491 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUFloat)
1492 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUFloat)
1493 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1494 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUFloat)
1495 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUFloat)
1496 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1497 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
1498 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
1500 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
1504 .Any({{DivV2S64}, {{VgprV2S64}, {VgprV2S64, VgprV2S64}}});
1505
1506 addRulesForGOpcs({G_FSUB, G_STRICT_FSUB}, Standard)
1507 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1508 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1509 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUFloat)
1510 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUFloat)
1511 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUFloat)
1512 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUFloat)
1514 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}});
1515
1516 addRulesForGOpcs({G_FMAD}, Standard)
1517 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16, Vgpr16}})
1518 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16, Vgpr16}})
1519 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
1520 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
1521
1522 addRulesForGOpcs({G_FLDEXP, G_STRICT_FLDEXP}, Standard)
1523 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}})
1524 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1525 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}})
1526 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1527 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr32}})
1528 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
1529
1530 addRulesForGOpcs({G_FMA, G_STRICT_FMA}, Standard)
1531 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16, Sgpr16}}, hasSALUFloat)
1532 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16, Vgpr16}}, !hasSALUFloat)
1533 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16, Vgpr16}})
1534 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32, Sgpr32}}, hasSALUFloat)
1535 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}}, !hasSALUFloat)
1536 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}})
1537 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64, Vgpr64}})
1538 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64, Vgpr64}})
1545
1546 addRulesForGOpcs({G_AMDGPU_FMED3}, Standard)
1547 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16, Vgpr16}})
1548 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16, Vgpr16}})
1549 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
1550 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
1551
1552 // TODO: This opcode is generated from the i64->i16 signed clamped pattern in
1553 // the PreLegalizerCombiner. Move the combine to RegBankCombiner to keep more
1554 // instructions on SALU.
1555 addRulesForGOpcs({G_AMDGPU_SMED3}, Standard)
1556 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
1557 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
1558
1559 // FNEG and FABS are either folded as source modifiers or can be selected as
1560 // bitwise XOR and AND with Mask. XOR and AND are available on SALU but for
1561 // targets without SALU float we still select them as VGPR since there would
1562 // be no real sgpr use.
1563 addRulesForGOpcs({G_FNEG, G_FABS}, Standard)
1564 .Uni(S16, {{UniInVgprS16}, {Vgpr16}}, !hasSALUFloat)
1565 .Uni(S16, {{Sgpr16}, {Sgpr16}}, hasSALUFloat)
1566 .Div(S16, {{Vgpr16}, {Vgpr16}})
1567 .Uni(S32, {{UniInVgprS32}, {Vgpr32}}, !hasSALUFloat)
1568 .Uni(S32, {{Sgpr32}, {Sgpr32}}, hasSALUFloat)
1569 .Div(S32, {{Vgpr32}, {Vgpr32}})
1570 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1571 .Div(S64, {{Vgpr64}, {Vgpr64}})
1572 .Uni(V2S16, {{SgprV2S16}, {SgprV2S16}})
1573 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}})
1574 .Any({{UniV2S32}, {{UniInVgprV2S32}, {VgprV2S32}}})
1575 .Any({{DivV2S32}, {{VgprV2S32}, {VgprV2S32}}});
1576
1577 addRulesForGOpcs({G_FCANONICALIZE}, Standard)
1578 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
1579 .Div(S32, {{Vgpr32}, {Vgpr32}})
1580 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
1581 .Div(S16, {{Vgpr16}, {Vgpr16}})
1582 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1583 .Div(S64, {{Vgpr64}, {Vgpr64}})
1584 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16}})
1585 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}})
1586 .Any({{UniV2S32}, {{UniInVgprV2S32}, {VgprV2S32}}})
1587 .Any({{DivV2S32}, {{VgprV2S32}, {VgprV2S32}}})
1588 .Any({{UniV2S64}, {{UniInVgprV2S64}, {VgprV2S64}}})
1589 .Any({{DivV2S64}, {{VgprV2S64}, {VgprV2S64}}});
1590
1591 bool hasPST = ST->hasPseudoScalarTrans();
1592 // Only 16-bit G_FSQRT operations are legal. F32/F64 is handled with a custom
1593 // legalization in the legalizer.
1594 addRulesForGOpcs({G_FSQRT})
1595 .Any({{DivS16}, {{Vgpr16}, {Vgpr16}}})
1596 .Any({{UniBF16}, {{UniInVgprS16}, {Vgpr16}}})
1597 .Any({{UniS16}, {{Sgpr16}, {Sgpr16}}}, hasPST)
1598 .Any({{UniS16}, {{UniInVgprS16}, {Vgpr16}}}, !hasPST);
1599
1600 addRulesForGOpcs({G_FPTOUI, G_FPTOSI, G_FPTOUI_SAT, G_FPTOSI_SAT})
1601 .Any({{UniS16, S16}, {{UniInVgprS16}, {Vgpr16}}})
1602 .Any({{DivS16, S16}, {{Vgpr16}, {Vgpr16}}})
1603 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}}, hasSALUFloat)
1604 .Any({{UniS32, S16}, {{UniInVgprS32}, {Vgpr16}}}, !hasSALUFloat)
1605 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}})
1606 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1607 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat)
1608 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1609 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}}, hasSALUFloat)
1610 .Any({{UniS32, S32}, {{UniInVgprS32}, {Vgpr32}}}, !hasSALUFloat)
1611 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1612 .Any({{UniS32, S64}, {{UniInVgprS32}, {Vgpr64}}})
1613 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}}})
1615 .Any({{DivV2S16, V2S32}, {{VgprV2S16}, {VgprV2S32}}});
1616
1617 addRulesForGOpcs({G_UITOFP, G_SITOFP})
1618 .Any({{UniS16, S16}, {{UniInVgprS16}, {Vgpr16}}})
1619 .Any({{DivS16, S16}, {{Vgpr16}, {Vgpr16}}})
1620 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1621 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat)
1622 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1623 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}}, hasSALUFloat)
1624 .Any({{UniS32, S32}, {{UniInVgprS32}, {Vgpr32}}}, !hasSALUFloat)
1625 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1626 .Any({{UniS64, S32}, {{UniInVgprS64}, {Vgpr32}}})
1627 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}}});
1628
1629 addRulesForGOpcs({G_AMDGPU_S_BUFFER_PREFETCH})
1631
1632 Predicate IsDataPF([](const MachineInstr &MI) -> bool {
1633 // prefetch cache type: 0 == instruction (I$) prefetch, 1 == data prefetch.
1634 return MI.getOperand(3).getImm() != 0;
1635 });
1636
1637 bool HasSMemPF = ST->hasSafeSmemPrefetch();
1638 bool HasVMemPF = ST->hasVmemPrefInsts();
1639 addRulesForGOpcs({G_PREFETCH})
1640 // Safe smem prefetch keeps both data and instruction prefetch.
1641 .Any({{UniPtr64}, {{}, {SgprPtr64}}}, HasSMemPF)
1642 // Vmem prefetch keeps data prefetch only.
1643 .Any({{{UniPtr64}, IsDataPF}, {{}, {SgprPtr64}}}, !HasSMemPF && HasVMemPF)
1644 .Any({{{UniPtr64}, IsDataPF}, {{}, {}, DeletePrefetch}},
1645 !HasSMemPF && !HasVMemPF)
1646 .Any({{{UniPtr64}, !IsDataPF}, {{}, {}, DeletePrefetch}}, !HasSMemPF)
1647
1648 .Any({{{DivPtr64}, IsDataPF}, {{}, {VgprPtr64}}}, HasVMemPF)
1649 .Any({{{DivPtr64}, IsDataPF}, {{}, {}, DeletePrefetch}}, !HasVMemPF)
1650 .Any({{{DivPtr64}, !IsDataPF}, {{}, {}, DeletePrefetch}})
1651
1652 .Any({{P3}, {{}, {}, DeletePrefetch}})
1653 .Any({{P5}, {{}, {}, DeletePrefetch}})
1654 .Any({{UniP6}, {{}, {SgprP6}}}, HasSMemPF)
1655 .Any({{UniP6}, {{}, {}, DeletePrefetch}}, !HasSMemPF);
1656
1657 addRulesForGOpcs({G_FPEXT})
1658 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}})
1659 .Any({{UniS64, S32}, {{UniInVgprS64}, {Vgpr32}}})
1660 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}}})
1661 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}}, hasSALUFloat)
1662 .Any({{UniS32, S16}, {{UniInVgprS32}, {Vgpr16}}}, !hasSALUFloat);
1663
1664 addRulesForGOpcs({G_AMDGPU_CVT_PK_I16_I32}, Standard)
1665 .Uni(V2S16, {{UniInVgprV2S16}, {Vgpr32, Vgpr32}})
1666 .Div(V2S16, {{VgprV2S16}, {Vgpr32, Vgpr32}});
1667
1668 addRulesForGOpcs({G_AMDGPU_FMIN_LEGACY, G_AMDGPU_FMAX_LEGACY}, Standard)
1669 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}})
1670 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}});
1671
1672 bool hasSALUMinimumMaximumInsts = ST->hasSALUMinimumMaximumInsts();
1673
1674 addRulesForGOpcs({G_FMINIMUM, G_FMAXIMUM}, Standard)
1675 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUMinimumMaximumInsts)
1676 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUMinimumMaximumInsts)
1677 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1678 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUMinimumMaximumInsts)
1679 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUMinimumMaximumInsts)
1680 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1681 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
1682 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
1684 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}});
1685
1686 addRulesForGOpcs({G_FMINNUM_IEEE, G_FMAXNUM_IEEE, G_FMINNUM, G_FMAXNUM,
1687 G_FMINIMUMNUM, G_FMAXIMUMNUM},
1688 Standard)
1689 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1690 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1691 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
1692 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
1694 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
1695 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUFloat)
1696 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUFloat)
1697 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUFloat)
1698 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUFloat);
1699
1700 addRulesForGOpcs({G_FPTRUNC})
1701 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1702 .Any({{UniS32, S64}, {{UniInVgprS32}, {Vgpr64}}})
1703 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}}})
1705 .Any({{DivV2S16, V2S32}, {{VgprV2S16}, {VgprV2S32}}})
1706 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1707 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat);
1708
1709 addRulesForGOpcs({G_INTRINSIC_FPTRUNC_ROUND})
1710 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1711 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat)
1712 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1713 .Any({{UniS16, S64}, {{UniInVgprS16}, {Vgpr64}}})
1714 .Any({{DivS16, S64}, {{Vgpr16}, {Vgpr64}}})
1715 .Any({{UniS32, S64}, {{UniInVgprS32}, {Vgpr64}}})
1716 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}}});
1717
1718 addRulesForGOpcs({G_IS_FPCLASS})
1719 .Any({{DivS1, S16}, {{Vcc}, {Vgpr16}}})
1720 .Any({{UniS1, S16}, {{UniInVcc}, {Vgpr16}}})
1721 .Any({{DivS1, S32}, {{Vcc}, {Vgpr32}}})
1722 .Any({{UniS1, S32}, {{UniInVcc}, {Vgpr32}}})
1723 .Any({{DivS1, S64}, {{Vcc}, {Vgpr64}}})
1724 .Any({{UniS1, S64}, {{UniInVcc}, {Vgpr64}}});
1725
1726 addRulesForGOpcs({G_FCMP}, Standard)
1727 .Any({{UniS1, _, S16}, {{Sgpr32Trunc}, {None, Sgpr16, Sgpr16}}},
1728 hasSALUFloat)
1729 .Any({{UniS1, _, S16}, {{UniInVcc}, {None, Vgpr16, Vgpr16}}},
1730 !hasSALUFloat)
1731 .Any({{DivS1, _, S16}, {{Vcc}, {None, Vgpr16, Vgpr16}}})
1732 .Any({{UniS1, _, S32}, {{Sgpr32Trunc}, {None, Sgpr32, Sgpr32}}},
1733 hasSALUFloat)
1734 .Any({{UniS1, _, S32}, {{UniInVcc}, {None, Vgpr32, Vgpr32}}},
1735 !hasSALUFloat)
1736 .Any({{DivS1, _, S32}, {{Vcc}, {None, Vgpr32, Vgpr32}}})
1737 .Any({{UniS1, _, S64}, {{UniInVcc}, {None, Vgpr64, Vgpr64}}})
1738 .Any({{DivS1, _, S64}, {{Vcc}, {None, Vgpr64, Vgpr64}}});
1739
1740 addRulesForGOpcs({G_INTRINSIC_ROUNDEVEN, G_FEXP2, G_FLOG2}, Standard)
1741 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
1742 .Div(S16, {{Vgpr16}, {Vgpr16}})
1743 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
1744 .Div(S32, {{Vgpr32}, {Vgpr32}})
1745 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1746 .Div(S64, {{Vgpr64}, {Vgpr64}});
1747
1748 addRulesForGOpcs({G_INTRINSIC_TRUNC, G_FFLOOR, G_FCEIL}, Standard)
1749 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
1750 .Uni(S16, {{Sgpr16}, {Sgpr16}}, hasSALUFloat)
1751 .Div(S16, {{Vgpr16}, {Vgpr16}})
1752 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
1753 .Uni(S32, {{Sgpr32}, {Sgpr32}}, hasSALUFloat)
1754 .Div(S32, {{Vgpr32}, {Vgpr32}})
1755 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1756 .Div(S64, {{Vgpr64}, {Vgpr64}});
1757
1758 addRulesForGOpcs({G_AMDGPU_GLOBAL_LOAD_MONITOR, G_AMDGPU_FLAT_LOAD_MONITOR},
1759 StandardB)
1760 .Uni(B32, {{UniInVgprB32}, {SgprPtr64}})
1761 .Div(B32, {{VgprB32}, {VgprPtr64}})
1762 .Uni(B64, {{UniInVgprB64}, {SgprPtr64}})
1763 .Div(B64, {{VgprB64}, {VgprPtr64}})
1764 .Uni(B128, {{UniInVgprB128}, {SgprPtr64}})
1765 .Div(B128, {{VgprB128}, {VgprPtr64}});
1766
1767 addRulesForGOpcs({G_AMDGPU_WHOLE_WAVE_FUNC_SETUP})
1768 .Any({{DivS1}, {{Vcc}, {}}});
1769
1770 addRulesForGOpcs({G_AMDGPU_WHOLE_WAVE_FUNC_RETURN}).Any({{}, {{}, {Vcc}}});
1771
1772 using namespace Intrinsic;
1773
1774 addRulesForIOpcs({returnaddress}).Any({{UniP0}, {{SgprP0}, {}}});
1775
1776 addRulesForIOpcs({amdgcn_s_getpc}).Any({{UniS64, _}, {{Sgpr64}, {}}});
1777
1778 addRulesForIOpcs({amdgcn_s_getreg}).Any({{}, {{Sgpr32}, {IntrId}}});
1779
1780 addRulesForIOpcs({amdgcn_s_setreg})
1781 .Any({{_, _, S32}, {{}, {IntrId, Imm, SgprB32_ReadFirstLane}}});
1782
1783 addRulesForIOpcs({amdgcn_s_sendmsg, amdgcn_s_sendmsghalt})
1784 .Any({{}, {{}, {IntrId, Imm, SgprB32_M0}}});
1785
1786 addRulesForIOpcs({amdgcn_s_sendmsg_rtn})
1787 .Any({{S32}, {{Sgpr32}, {}}})
1788 .Any({{S64}, {{Sgpr64}, {}}});
1789
1790 addRulesForIOpcs({amdgcn_s_memrealtime, amdgcn_s_memtime}, Standard)
1791 .Uni(S64, {{Sgpr64}, {IntrId}});
1792
1793 addRulesForIOpcs({amdgcn_groupstaticsize, amdgcn_pops_exiting_wave_id,
1794 amdgcn_reloc_constant, amdgcn_s_get_waveid_in_workgroup},
1795 Standard)
1796 .Uni(S32, {{Sgpr32}, {IntrId}});
1797
1798 // Intrinsics with no register operands.
1799 addRulesForIOpcs({amdgcn_asyncmark,
1800 amdgcn_endpgm,
1801 amdgcn_iglp_opt,
1802 amdgcn_init_exec,
1803 amdgcn_s_barrier,
1804 amdgcn_s_barrier_leave,
1805 amdgcn_s_barrier_signal,
1806 amdgcn_s_barrier_wait,
1807 amdgcn_s_decperflevel,
1808 amdgcn_s_incperflevel,
1809 amdgcn_s_monitor_sleep,
1810 amdgcn_s_nop,
1811 amdgcn_s_sethalt,
1812 amdgcn_s_setprio,
1813 amdgcn_s_setprio_inc_wg,
1814 amdgcn_s_sleep,
1815 amdgcn_s_ttracedata_imm,
1816 amdgcn_s_wait_asynccnt,
1817 amdgcn_s_wait_bvhcnt,
1818 amdgcn_s_wait_dscnt,
1819 amdgcn_s_wait_event,
1820 amdgcn_s_wait_event_export_ready,
1821 amdgcn_s_wait_expcnt,
1822 amdgcn_s_wait_kmcnt,
1823 amdgcn_s_wait_loadcnt,
1824 amdgcn_s_wait_samplecnt,
1825 amdgcn_s_wait_storecnt,
1826 amdgcn_s_wait_tensorcnt,
1827 amdgcn_s_waitcnt,
1828 amdgcn_sched_barrier,
1829 amdgcn_sched_group_barrier,
1830 amdgcn_unreachable,
1831 amdgcn_wait_asyncmark,
1832 amdgcn_wave_barrier})
1833 .Any({{}, {{}, {}}});
1834
1835 addRulesForIOpcs({amdgcn_init_exec_from_input})
1836 .Any({{}, {{}, {IntrId, Sgpr32}}});
1837
1838 addRulesForIOpcs({amdgcn_s_ttracedata}).Any({{}, {{}, {IntrId, SgprB32_M0}}});
1839
1840 addRulesForIOpcs({amdgcn_s_sleep_var})
1841 .Any({{}, {{}, {IntrId, SgprB32_ReadFirstLane}}});
1842
1843 addRulesForIOpcs({amdgcn_s_barrier_join, amdgcn_s_wakeup_barrier})
1844 .Any({{}, {{}, {IntrId, SgprB32_M0}}});
1845
1846 addRulesForIOpcs({amdgcn_s_barrier_signal_var, amdgcn_s_barrier_init})
1847 .Any({{}, {{}, {IntrId, SgprB32_M0, SgprB32_M0}}});
1848
1849 addRulesForIOpcs({amdgcn_s_barrier_signal_isfirst})
1850 .Any({{UniS1}, {{Sgpr32Trunc}, {}}});
1851
1852 addRulesForIOpcs(
1853 {amdgcn_s_get_named_barrier_state, amdgcn_s_get_barrier_state}, Standard)
1854 .Uni(S32, {{Sgpr32}, {IntrId, SgprB32_M0}});
1855
1856 addRulesForIOpcs({amdgcn_flat_prefetch}).Any({{}, {{}, {IntrId, VgprP0}}});
1857
1858 addRulesForIOpcs({amdgcn_global_prefetch}).Any({{}, {{}, {IntrId, VgprP1}}});
1859
1860 addRulesForIOpcs({amdgcn_s_prefetch_data, amdgcn_s_prefetch_inst})
1862
1863 addRulesForIOpcs({amdgcn_class})
1864 .Any({{UniS1, _, S16}, {{UniInVcc}, {IntrId, Vgpr16, Vgpr32}}})
1865 .Any({{DivS1, _, S16}, {{Vcc}, {IntrId, Vgpr16, Vgpr32}}})
1866 .Any({{UniS1, _, S32}, {{UniInVcc}, {IntrId, Vgpr32, Vgpr32}}})
1867 .Any({{DivS1, _, S32}, {{Vcc}, {IntrId, Vgpr32, Vgpr32}}})
1868 .Any({{UniS1, _, S64}, {{UniInVcc}, {IntrId, Vgpr64, Vgpr32}}})
1869 .Any({{DivS1, _, S64}, {{Vcc}, {IntrId, Vgpr64, Vgpr32}}});
1870
1871 // This is "intrinsic lane mask" it was set to i32/i64 in llvm-ir.
1872 addRulesForIOpcs({amdgcn_end_cf})
1873 .Any({{_, UniS32}, {{}, {IntrId, Sgpr32}}})
1874 .Any({{_, UniS64}, {{}, {IntrId, Sgpr64}}});
1875
1876 addRulesForIOpcs({amdgcn_if_break}, Standard)
1877 .Uni(S64, {{Sgpr64}, {IntrId, Vcc, Sgpr64}})
1878 .Uni(S32, {{Sgpr32}, {IntrId, Vcc, Sgpr32}});
1879
1880 addRulesForIOpcs({amdgcn_exp})
1881 .Any({{_, _, _, S32, S32, S32, S32},
1882 {{}, {IntrId, Imm, Imm, Vgpr32, Vgpr32, Vgpr32, Vgpr32}}});
1883
1884 addRulesForIOpcs({amdgcn_exp_compr})
1885 .Any({{_, _, _, V2S16}, {{}, {IntrId, Imm, Imm, VgprV2S16, VgprV2S16}}});
1886
1887 addRulesForIOpcs({amdgcn_exp_row})
1888 .Any({{_, _, _, S32, S32, S32, S32, _, S32},
1889 {{},
1891 SgprB32_M0}}});
1892
1893 addRulesForIOpcs({amdgcn_lds_direct_load}, StandardB)
1894 .Div(B32, {{VgprB32}, {IntrId, SgprB32_M0}});
1895
1896 addRulesForIOpcs({amdgcn_lds_param_load}, Standard)
1897 .Div(S32, {{Vgpr32}, {IntrId, Imm, Imm, SgprB32_M0}});
1898
1899 addRulesForIOpcs({amdgcn_mbcnt_lo, amdgcn_mbcnt_hi}, Standard)
1900 .Div(S32, {{}, {Vgpr32, None, Vgpr32, Vgpr32}});
1901
1902 addRulesForIOpcs({amdgcn_readfirstlane})
1903 .Any({{UniB32, _, DivB32}, {{}, {SgprB32, None, VgprB32}}})
1904 // this should not exist in the first place, it is from call lowering
1905 // readfirstlaning just in case register is not in sgpr.
1906 .Any({{UniS32, _, UniS32}, {{}, {Sgpr32, None, Vgpr32}}});
1907
1908 addRulesForIOpcs({amdgcn_readlane}, StandardB)
1910
1911 addRulesForIOpcs({amdgcn_s_quadmask, amdgcn_s_wqm}, StandardB)
1913 .Uni(B64, {{SgprB64}, {IntrId, SgprB64_ReadFirstLane}});
1914
1915 addRulesForIOpcs({amdgcn_writelane}, StandardB)
1916 .Div(B32,
1917 {{VgprB32},
1919
1920 addRulesForIOpcs({amdgcn_add_max_i32, amdgcn_add_max_u32, amdgcn_add_min_i32,
1921 amdgcn_add_min_u32},
1922 Standard)
1923 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1924 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1925
1926 addRulesForIOpcs({amdgcn_pk_add_max_i16, amdgcn_pk_add_max_u16,
1927 amdgcn_pk_add_min_i16, amdgcn_pk_add_min_u16},
1928 Standard)
1931
1932 addRulesForIOpcs({amdgcn_permlane16, amdgcn_permlanex16}, StandardB)
1933 .Div(B32, {{VgprB32},
1936
1937 addRulesForIOpcs({amdgcn_permlane_bcast, amdgcn_permlane_up,
1938 amdgcn_permlane_down, amdgcn_permlane_xor},
1939 StandardB)
1940 .Div(B32,
1941 {{VgprB32},
1943
1944 addRulesForIOpcs({amdgcn_permlane_idx_gen}, Standard)
1946
1947 addRulesForIOpcs({amdgcn_alignbyte, amdgcn_perm}, Standard)
1948 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1949 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1950
1951 addRulesForIOpcs({amdgcn_mqsad_pk_u16_u8, amdgcn_qsad_pk_u16_u8}, Standard)
1952 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr32, Vgpr64}})
1953 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr32, Vgpr64}});
1954
1955 addRulesForIOpcs({amdgcn_mqsad_u32_u8})
1956 .Any(
1959
1960 addRulesForIOpcs({amdgcn_lerp}, Standard)
1961 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1962 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1963
1964 addRulesForIOpcs(
1965 {amdgcn_msad_u8, amdgcn_sad_hi_u8, amdgcn_sad_u16, amdgcn_sad_u8},
1966 Standard)
1967 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1968 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1969
1970 addRulesForIOpcs(
1971 {amdgcn_wave_reduce_add, amdgcn_wave_reduce_and, amdgcn_wave_reduce_fadd,
1972 amdgcn_wave_reduce_fmax, amdgcn_wave_reduce_fmin,
1973 amdgcn_wave_reduce_fsub, amdgcn_wave_reduce_max, amdgcn_wave_reduce_min,
1974 amdgcn_wave_reduce_or, amdgcn_wave_reduce_sub, amdgcn_wave_reduce_umax,
1975 amdgcn_wave_reduce_umin, amdgcn_wave_reduce_xor},
1976 Standard)
1977 .Uni(S32, {{Sgpr32}, {IntrId, Sgpr32}})
1978 .Div(S32, {{Sgpr32ToVgprDst}, {IntrId, VgprB32}})
1979 .Uni(S64, {{Sgpr64}, {IntrId, Sgpr64}})
1980 .Div(S64, {{Sgpr64ToVgprDst}, {IntrId, VgprB64}});
1981
1982 addRulesForIOpcs({amdgcn_wave_shuffle}, Standard)
1983 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}})
1984 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
1985
1986 addRulesForIOpcs({amdgcn_bitop3, amdgcn_fmad_ftz}, Standard)
1987 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
1988 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
1989 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1990 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1991
1992 addRulesForIOpcs({amdgcn_udot4, amdgcn_sdot4, amdgcn_udot8, amdgcn_sdot8,
1993 amdgcn_dot4_f32_bf8_bf8, amdgcn_dot4_f32_bf8_fp8,
1994 amdgcn_dot4_f32_fp8_fp8, amdgcn_dot4_f32_fp8_bf8},
1995 Standard)
1996 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1997 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1998
1999 addRulesForIOpcs({amdgcn_rsq, amdgcn_rsq_clamp})
2000 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2001 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2002 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2003 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2004 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2005 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST)
2006 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2007 .Any({{UniS64}, {{UniInVgprS64}, {IntrId, Vgpr64}}})
2008 .Any({{DivS64}, {{Vgpr64}, {IntrId, Vgpr64}}});
2009
2010 addRulesForIOpcs({amdgcn_mul_u24, amdgcn_mul_i24}, Standard)
2011 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}})
2012 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}})
2013 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr32, Vgpr32}})
2014 .Div(S64, {{Vgpr64}, {IntrId, Vgpr32, Vgpr32}});
2015
2016 addRulesForIOpcs({amdgcn_ds_bpermute, amdgcn_ds_bpermute_fi_b32,
2017 amdgcn_ds_permute, amdgcn_fmul_legacy, amdgcn_mulhi_i24,
2018 amdgcn_mulhi_u24},
2019 Standard)
2020 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}})
2021 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
2022
2023 addRulesForIOpcs({amdgcn_cvt_sr_bf8_f32, amdgcn_cvt_sr_fp8_f32,
2024 amdgcn_cvt_sr_fp8_f32_e5m3, amdgcn_cvt_pk_bf8_f32,
2025 amdgcn_cvt_pk_fp8_f32, amdgcn_cvt_pk_fp8_f32_e5m3,
2026 amdgcn_cvt_pk_u8_f32},
2027 Standard)
2028 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2029 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2030
2031 addRulesForIOpcs({amdgcn_cvt_off_f32_i4, amdgcn_cvt_f32_bf8,
2032 amdgcn_cvt_f32_fp8, amdgcn_cvt_f32_fp8_e5m3},
2033 Standard)
2034 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}})
2035 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}});
2036
2037 addRulesForIOpcs({amdgcn_cvt_pk_f32_bf8, amdgcn_cvt_pk_f32_fp8})
2038 .Any({{UniV2S32}, {{UniInVgprV2S32}, {IntrId, Vgpr32}}})
2039 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, Vgpr32}}});
2040
2041 addRulesForIOpcs({amdgcn_cvt_f16_bf8, amdgcn_cvt_f16_fp8}, Standard)
2042 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr32}})
2043 .Div(S16, {{Vgpr16}, {IntrId, Vgpr32}});
2044
2045 addRulesForIOpcs({amdgcn_cvt_pk_f16_bf8, amdgcn_cvt_pk_f16_fp8}, Standard)
2046 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr16}})
2047 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr16}});
2048
2049 addRulesForIOpcs({amdgcn_cvt_pk_bf8_f16, amdgcn_cvt_pk_fp8_f16}, Standard)
2050 .Uni(S16, {{UniInVgprS16}, {IntrId, VgprV2S16}})
2051 .Div(S16, {{Vgpr16}, {IntrId, VgprV2S16}});
2052
2053 addRulesForIOpcs({amdgcn_cvt_sr_bf8_f16, amdgcn_cvt_sr_fp8_f16}, Standard)
2054 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr16, Vgpr32, Vgpr32}})
2055 .Div(S32, {{Vgpr32}, {IntrId, Vgpr16, Vgpr32, Vgpr32}});
2056
2057 addRulesForIOpcs({amdgcn_cvt_sr_pk_f16_f32, amdgcn_cvt_sr_pk_bf16_f32},
2058 Standard)
2060 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2061
2062 addRulesForIOpcs(
2063 {amdgcn_cvt_scalef32_sr_fp8_f16, amdgcn_cvt_scalef32_sr_bf8_f16,
2064 amdgcn_cvt_scalef32_sr_fp8_bf16, amdgcn_cvt_scalef32_sr_bf8_bf16})
2065 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32, Vgpr16, Vgpr32, Vgpr32}}})
2066 .Any({{UniS32},
2068
2069 addRulesForIOpcs(
2070 {amdgcn_cvt_scalef32_sr_fp8_f32, amdgcn_cvt_scalef32_sr_bf8_f32})
2071 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vgpr32}}})
2072 .Any({{UniS32},
2074
2075 addRulesForIOpcs({amdgcn_cubesc, amdgcn_cubetc, amdgcn_cubema, amdgcn_cubeid,
2076 amdgcn_fma_legacy},
2077 Standard)
2078 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2079 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2080
2081 addRulesForIOpcs({amdgcn_frexp_mant, amdgcn_fract}, Standard)
2082 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16}})
2083 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16}})
2084 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}})
2085 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}})
2086 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64}})
2087 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64}});
2088
2089 addRulesForIOpcs({amdgcn_prng_b32})
2090 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}})
2091 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}});
2092
2093 addRulesForIOpcs({amdgcn_sffbh}, Standard)
2094 .Uni(S32, {{Sgpr32}, {IntrId, Sgpr32}})
2095 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}});
2096
2097 addRulesForIOpcs({amdgcn_ubfe, amdgcn_sbfe}, Standard)
2098 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2099 .Uni(S32, {{Sgpr32}, {IntrId, Sgpr32, Sgpr32, Sgpr32}, S_BFE})
2100 .Uni(S64, {{Sgpr64}, {IntrId, Sgpr64, Sgpr32, Sgpr32}, S_BFE})
2101 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr32, Vgpr32}, V_BFE});
2102
2103 addRulesForIOpcs({amdgcn_cvt_pk_i16, amdgcn_cvt_pk_u16, amdgcn_cvt_pknorm_i16,
2104 amdgcn_cvt_pknorm_u16},
2105 Standard)
2106 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr32, Vgpr32}})
2107 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32}});
2108
2109 addRulesForIOpcs({amdgcn_cvt_pkrtz}, Standard)
2110 .Uni(V2S16, {{SgprV2S16}, {IntrId, Sgpr32, Sgpr32}}, hasSALUFloat)
2111 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr32, Vgpr32}}, !hasSALUFloat)
2112 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32}});
2113
2114 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk32_bf6_f16,
2115 amdgcn_cvt_scalef32_sr_pk32_fp6_f16,
2116 amdgcn_cvt_scalef32_sr_pk32_bf6_bf16,
2117 amdgcn_cvt_scalef32_sr_pk32_fp6_bf16},
2118 Standard)
2120 .Any({{UniV6S32},
2122
2123 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk32_bf6_f32,
2124 amdgcn_cvt_scalef32_sr_pk32_fp6_f32},
2125 Standard)
2127 .Any({{UniV6S32},
2129
2130 addRulesForIOpcs(
2131 {amdgcn_cvt_scalef32_sr_pk_fp4_f16, amdgcn_cvt_scalef32_sr_pk_fp4_bf16},
2132 Standard)
2134 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, VgprV2S16, Vgpr32, Vgpr32}});
2135
2136 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk_fp4_f32}, Standard)
2138 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, VgprV2S32, Vgpr32, Vgpr32}});
2139
2140 addRulesForIOpcs(
2141 {amdgcn_cvt_scalef32_2xpk16_fp6_f32, amdgcn_cvt_scalef32_2xpk16_bf6_f32})
2142 .Any(
2144 .Any({{UniV6S32},
2146
2147 addRulesForIOpcs({amdgcn_cvt_scalef32_f16_fp8, amdgcn_cvt_scalef32_f16_bf8},
2148 Standard)
2149 .Div(V2S16, {{VgprV2S16}, {IntrId, VgprV2S16, Vgpr32, Vgpr32}})
2151
2152 addRulesForIOpcs({amdgcn_cvt_scalef32_f32_fp8, amdgcn_cvt_scalef32_f32_bf8},
2153 Standard)
2154 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}})
2155 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}});
2156
2157 addRulesForIOpcs(
2158 {amdgcn_cvt_scalef32_pk16_bf6_f16, amdgcn_cvt_scalef32_pk16_fp6_f16,
2159 amdgcn_cvt_scalef32_pk16_bf6_bf16, amdgcn_cvt_scalef32_pk16_fp6_bf16},
2160 Standard)
2163
2164 addRulesForIOpcs(
2165 {amdgcn_cvt_scalef32_pk16_bf6_f32, amdgcn_cvt_scalef32_pk16_fp6_f32},
2166 Standard)
2169
2170 addRulesForIOpcs(
2171 {amdgcn_cvt_scalef32_pk8_bf8_f16, amdgcn_cvt_scalef32_pk8_fp8_f16,
2172 amdgcn_cvt_scalef32_pk8_bf8_bf16, amdgcn_cvt_scalef32_pk8_fp8_bf16},
2173 Standard)
2176
2177 addRulesForIOpcs(
2178 {amdgcn_cvt_scalef32_pk8_bf8_f32, amdgcn_cvt_scalef32_pk8_fp8_f32},
2179 Standard)
2182
2183 addRulesForIOpcs(
2184 {amdgcn_cvt_scalef32_pk8_fp4_f16, amdgcn_cvt_scalef32_pk8_fp4_bf16},
2185 Standard)
2186 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S16, Vgpr32}})
2187 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S16, Vgpr32}});
2188
2189 addRulesForIOpcs({amdgcn_cvt_scalef32_pk8_fp4_f32}, Standard)
2190 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S32, Vgpr32}})
2191 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S32, Vgpr32}});
2192
2193 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk16_bf6_f16,
2194 amdgcn_cvt_scalef32_sr_pk16_fp6_f16,
2195 amdgcn_cvt_scalef32_sr_pk16_bf6_bf16,
2196 amdgcn_cvt_scalef32_sr_pk16_fp6_bf16},
2197 Standard)
2199 .Any({{UniV3S32},
2201
2202 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk16_bf6_f32,
2203 amdgcn_cvt_scalef32_sr_pk16_fp6_f32},
2204 Standard)
2206 .Any({{UniV3S32},
2208
2209 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk8_bf8_f16,
2210 amdgcn_cvt_scalef32_sr_pk8_fp8_f16,
2211 amdgcn_cvt_scalef32_sr_pk8_bf8_bf16,
2212 amdgcn_cvt_scalef32_sr_pk8_fp8_bf16},
2213 Standard)
2215 .Any({{UniV2S32},
2217
2218 addRulesForIOpcs(
2219 {amdgcn_cvt_scalef32_sr_pk8_bf8_f32, amdgcn_cvt_scalef32_sr_pk8_fp8_f32},
2220 Standard)
2222 .Any({{UniV2S32},
2224
2225 addRulesForIOpcs(
2226 {amdgcn_cvt_scalef32_sr_pk8_fp4_f16, amdgcn_cvt_scalef32_sr_pk8_fp4_bf16},
2227 Standard)
2228 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S16, Vgpr32, Vgpr32}})
2229 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S16, Vgpr32, Vgpr32}});
2230
2231 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk8_fp4_f32}, Standard)
2232 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S32, Vgpr32, Vgpr32}})
2233 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S32, Vgpr32, Vgpr32}});
2234
2235 addRulesForIOpcs(
2236 {amdgcn_cvt_scale_pk16_f16_bf6, amdgcn_cvt_scale_pk16_f16_fp6,
2237 amdgcn_cvt_scale_pk16_bf16_bf6, amdgcn_cvt_scale_pk16_bf16_fp6},
2238 Standard)
2241
2242 addRulesForIOpcs(
2243 {amdgcn_cvt_scale_pk16_f32_bf6, amdgcn_cvt_scale_pk16_f32_fp6}, Standard)
2246
2247 addRulesForIOpcs({amdgcn_cvt_scale_pk8_f16_bf8, amdgcn_cvt_scale_pk8_f16_fp8,
2248 amdgcn_cvt_scale_pk8_bf16_bf8,
2249 amdgcn_cvt_scale_pk8_bf16_fp8},
2250 Standard)
2253
2254 addRulesForIOpcs(
2255 {amdgcn_cvt_scale_pk8_f16_fp4, amdgcn_cvt_scale_pk8_bf16_fp4}, Standard)
2256 .Any({{DivV8S16}, {{VgprV8S16}, {IntrId, Vgpr32, Vgpr32}}})
2258
2259 addRulesForIOpcs({amdgcn_cvt_scale_pk8_f32_bf8, amdgcn_cvt_scale_pk8_f32_fp8},
2260 Standard)
2263
2264 addRulesForIOpcs({amdgcn_cvt_scale_pk8_f32_fp4}, Standard)
2265 .Any({{DivV8S32}, {{VgprV8S32}, {IntrId, Vgpr32, Vgpr32}}})
2267
2268 addRulesForIOpcs(
2269 {amdgcn_cvt_scalef32_pk32_bf6_f16, amdgcn_cvt_scalef32_pk32_fp6_f16,
2270 amdgcn_cvt_scalef32_pk32_bf6_bf16, amdgcn_cvt_scalef32_pk32_fp6_bf16},
2271 Standard)
2274
2275 addRulesForIOpcs(
2276 {amdgcn_cvt_scalef32_pk32_bf6_f32, amdgcn_cvt_scalef32_pk32_fp6_f32},
2277 Standard)
2280
2281 addRulesForIOpcs(
2282 {amdgcn_cvt_scalef32_pk_fp8_f32, amdgcn_cvt_scalef32_pk_bf8_f32},
2283 Standard)
2285 .Uni(V2S16,
2287
2288 addRulesForIOpcs(
2289 {amdgcn_cvt_scalef32_pk_f32_fp8, amdgcn_cvt_scalef32_pk_f32_bf8},
2290 Standard)
2291 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, Vgpr32, Vgpr32}}})
2293
2294 addRulesForIOpcs(
2295 {amdgcn_cvt_scalef32_pk_fp8_f16, amdgcn_cvt_scalef32_pk_bf8_f16,
2296 amdgcn_cvt_scalef32_pk_fp8_bf16, amdgcn_cvt_scalef32_pk_bf8_bf16},
2297 Standard)
2300
2301 addRulesForIOpcs({amdgcn_cvt_scalef32_pk_f32_fp4}, Standard)
2302 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, Vgpr32, Vgpr32}}})
2304
2305 addRulesForIOpcs({amdgcn_cvt_scalef32_pk_fp4_f32}, Standard)
2306 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vgpr32}})
2307 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vgpr32}});
2308
2309 addRulesForIOpcs(
2310 {amdgcn_cvt_scalef32_pk_f16_fp4, amdgcn_cvt_scalef32_pk_f16_fp8,
2311 amdgcn_cvt_scalef32_pk_f16_bf8, amdgcn_cvt_scalef32_pk_bf16_fp4,
2312 amdgcn_cvt_scalef32_pk_bf16_fp8, amdgcn_cvt_scalef32_pk_bf16_bf8},
2313 Standard)
2314 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32}})
2315 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr32, Vgpr32}});
2316
2317 addRulesForIOpcs(
2318 {amdgcn_cvt_scalef32_pk32_f32_fp6, amdgcn_cvt_scalef32_pk32_f32_bf6},
2319 Standard)
2322
2323 addRulesForIOpcs(
2324 {amdgcn_cvt_scalef32_pk32_f16_fp6, amdgcn_cvt_scalef32_pk32_f16_bf6,
2325 amdgcn_cvt_scalef32_pk32_bf16_fp6, amdgcn_cvt_scalef32_pk32_bf16_bf6},
2326 Standard)
2329
2330 addRulesForIOpcs(
2331 {amdgcn_cvt_scalef32_pk_fp4_f16, amdgcn_cvt_scalef32_pk_fp4_bf16},
2332 Standard)
2333 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, VgprV2S16, Vgpr32}})
2334 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, VgprV2S16, Vgpr32}});
2335
2336 addRulesForIOpcs({amdgcn_global_load_tr_b64})
2337 .Any({{DivB64, _, UniP1}, {{VgprB64}, {IntrId, SgprP1}}})
2338 .Any({{DivB64, _, DivP1}, {{VgprB64}, {IntrId, VgprP1}}})
2339 .Any({{DivB32, _, UniP1}, {{VgprB32}, {IntrId, SgprP1}}})
2340 .Any({{DivB32, _, DivP1}, {{VgprB32}, {IntrId, VgprP1}}});
2341
2342 addRulesForIOpcs({amdgcn_global_load_tr_b128})
2343 .Any({{DivB64, _, UniP1}, {{VgprB64}, {IntrId, SgprP1}}})
2344 .Any({{DivB64, _, DivP1}, {{VgprB64}, {IntrId, VgprP1}}})
2345 .Any({{DivB128, _, UniP1}, {{VgprB128}, {IntrId, SgprP1}}})
2346 .Any({{DivB128, _, DivP1}, {{VgprB128}, {IntrId, VgprP1}}});
2347
2348 addRulesForIOpcs({amdgcn_global_load_tr4_b64})
2349 .Any({{DivV2S32, _, UniP1}, {{VgprV2S32}, {IntrId, SgprP1}}})
2350 .Any({{DivV2S32, _, DivP1}, {{VgprV2S32}, {IntrId, VgprP1}}});
2351
2352 addRulesForIOpcs({amdgcn_global_load_tr6_b96})
2353 .Any({{DivV3S32, _, UniP1}, {{VgprV3S32}, {IntrId, SgprP1}}})
2354 .Any({{DivV3S32, _, DivP1}, {{VgprV3S32}, {IntrId, VgprP1}}});
2355
2356 addRulesForIOpcs({amdgcn_ds_load_tr4_b64, amdgcn_ds_load_tr8_b64})
2357 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, VgprP3}}});
2358
2359 addRulesForIOpcs({amdgcn_ds_load_tr6_b96})
2360 .Any({{DivV3S32}, {{VgprV3S32}, {IntrId, VgprP3}}});
2361
2362 addRulesForIOpcs({amdgcn_ds_load_tr16_b128})
2363 .Any({{DivB128}, {{VgprB128}, {IntrId, VgprP3}}});
2364
2365 addRulesForIOpcs({amdgcn_global_atomic_ordered_add_b64})
2366 .Any({{DivS64}, {{Vgpr64}, {IntrId, VgprP1, Vgpr64}}});
2367
2368 addRulesForIOpcs(
2369 {amdgcn_global_atomic_fmin_num, amdgcn_global_atomic_fmax_num}, Standard)
2370 .Div(S32, {{Vgpr32}, {IntrId, VgprP1, Vgpr32}});
2371
2372 addRulesForIOpcs({amdgcn_flat_atomic_fmin_num, amdgcn_flat_atomic_fmax_num},
2373 Standard)
2374 .Div(S32, {{Vgpr32}, {IntrId, VgprP0, Vgpr32}});
2375
2376 addRulesForIOpcs({amdgcn_raw_buffer_load_lds})
2377 .Any({{_}, {{}, {IntrId, SgprV4S32, SgprP3, Imm, Vgpr32, Sgpr32}}});
2378
2379 addRulesForIOpcs({amdgcn_raw_buffer_load_async_lds})
2380 .Any({{_}, {{}, {IntrId, SgprV4S32, SgprB32_M0, Imm, Vgpr32, Sgpr32}}});
2381
2382 addRulesForIOpcs({amdgcn_struct_buffer_load_async_lds})
2383 .Any(
2384 {{_},
2386
2387 addRulesForIOpcs({amdgcn_struct_buffer_load_lds})
2388 .Any({{_},
2389 {{}, {IntrId, SgprV4S32, SgprP3, Imm, Vgpr32, Vgpr32, Sgpr32}}});
2390
2391 addRulesForIOpcs({amdgcn_raw_ptr_buffer_load_lds})
2392 .Any({{_}, {{}, {IntrId, SgprP8, SgprP3, Imm, Vgpr32, Sgpr32}}});
2393
2394 addRulesForIOpcs({amdgcn_raw_ptr_buffer_load_async_lds})
2395 .Any({{}, {{}, {IntrId, SgprP8, SgprB32_M0, Imm, VgprB32, SgprB32}}});
2396
2397 addRulesForIOpcs({amdgcn_struct_ptr_buffer_load_async_lds})
2398 .Any({{_},
2399 {{}, {IntrId, SgprP8, SgprB32_M0, Imm, Vgpr32, Vgpr32, Sgpr32}}});
2400
2401 addRulesForIOpcs({amdgcn_struct_ptr_buffer_load_lds})
2402 .Any({{_}, {{}, {IntrId, SgprP8, SgprP3, Imm, Vgpr32, Vgpr32, Sgpr32}}});
2403
2404 addRulesForIOpcs(
2405 {amdgcn_global_load_lds, amdgcn_load_to_lds, amdgcn_load_async_to_lds})
2406 .Any({{}, {{}, {IntrId, VgprP1, SgprB32_M0}}});
2407
2408 addRulesForIOpcs({amdgcn_global_load_async_to_lds_b8,
2409 amdgcn_global_load_async_to_lds_b32,
2410 amdgcn_global_load_async_to_lds_b64,
2411 amdgcn_global_load_async_to_lds_b128,
2412 amdgcn_global_store_async_from_lds_b8,
2413 amdgcn_global_store_async_from_lds_b32,
2414 amdgcn_global_store_async_from_lds_b64,
2415 amdgcn_global_store_async_from_lds_b128})
2416 .Any({{}, {{}, {IntrId, VgprP1, VgprP3}}});
2417
2418 addRulesForIOpcs({amdgcn_global_load_async_lds})
2419 .Any({{}, {{}, {IntrId, VgprP1, SgprB32_M0}}});
2420
2421 addRulesForIOpcs({amdgcn_tensor_load_to_lds, amdgcn_tensor_store_from_lds})
2422 .Any({{},
2423 {{},
2427
2428 addRulesForIOpcs({amdgcn_cluster_load_b32})
2430 .Any({{DivB32, _, UniP1}, {{VgprB32}, {IntrId, SgprP1, Imm, SgprB32_M0}}})
2431 .Any(
2432 {{DivB32, _, DivP1}, {{VgprB32}, {IntrId, VgprP1, Imm, SgprB32_M0}}});
2433
2434 addRulesForIOpcs({amdgcn_cluster_load_b64})
2436 .Any({{DivB64, _, UniP1}, {{VgprB64}, {IntrId, SgprP1, Imm, SgprB32_M0}}})
2437 .Any(
2438 {{DivB64, _, DivP1}, {{VgprB64}, {IntrId, VgprP1, Imm, SgprB32_M0}}});
2439
2440 addRulesForIOpcs({amdgcn_cluster_load_b128})
2442 .Any({{DivB128, _, UniP1},
2443 {{VgprB128}, {IntrId, SgprP1, Imm, SgprB32_M0}}})
2444 .Any({{DivB128, _, DivP1},
2445 {{VgprB128}, {IntrId, VgprP1, Imm, SgprB32_M0}}});
2446
2447 addRulesForIOpcs({amdgcn_cluster_load_async_to_lds_b8,
2448 amdgcn_cluster_load_async_to_lds_b32,
2449 amdgcn_cluster_load_async_to_lds_b64,
2450 amdgcn_cluster_load_async_to_lds_b128})
2451 .Any({{}, {{}, {IntrId, VgprP1, VgprP3, Imm, Imm, SgprB32_M0}}});
2452
2453 addRulesForIOpcs({amdgcn_perm_pk16_b4_u4}, StandardB)
2454 .Uni(B64, {{UniInVgprB64}, {IntrId, Vgpr32, Vgpr32, VgprV2S32}})
2455 .Div(B64, {{VgprB64}, {IntrId, Vgpr32, Vgpr32, VgprV2S32}});
2456
2457 addRulesForIOpcs({amdgcn_perm_pk16_b6_u4}, StandardB)
2459 .Div(B96, {{VgprB96}, {IntrId, Vgpr32, VgprB64, VgprV2S32}});
2460
2461 addRulesForIOpcs({amdgcn_perm_pk16_b8_u4}, StandardB)
2463 .Div(B128, {{VgprB128}, {IntrId, VgprB64, VgprB64, VgprV2S32}});
2464
2465 addRulesForIOpcs({amdgcn_wwm, amdgcn_strict_wwm, amdgcn_wqm, amdgcn_softwqm,
2466 amdgcn_strict_wqm},
2467 StandardB)
2468 .Div(B32, {{VgprB32}, {IntrId, VgprB32}})
2469 .Uni(B32, {{SgprB32}, {IntrId, SgprB32}})
2470 .Div(B64, {{VgprB64}, {IntrId, VgprB64}})
2471 .Uni(B64, {{SgprB64}, {IntrId, SgprB64}})
2472 .Div(B96, {{VgprB96}, {IntrId, VgprB96}})
2473 .Uni(B96, {{SgprB96}, {IntrId, SgprB96}})
2474 .Div(B128, {{VgprB128}, {IntrId, VgprB128}})
2475 .Uni(B128, {{SgprB128}, {IntrId, SgprB128}})
2476 .Any({{UniB256}, {{SgprB256}, {IntrId, SgprB256}}})
2477 .Any({{DivB256}, {{VgprB256}, {IntrId, VgprB256}}})
2478 .Any({{UniB512}, {{SgprB512}, {IntrId, SgprB512}}})
2479 .Any({{DivB512}, {{VgprB512}, {IntrId, VgprB512}}});
2480
2481 addRulesForIOpcs({amdgcn_init_whole_wave}).Any({{DivS1}, {{Vcc}, {IntrId}}});
2482
2483 addRulesForIOpcs({amdgcn_kill, amdgcn_wqm_demote})
2484 .Any({{}, {{}, {IntrId, Vcc}}});
2485
2486 addRulesForIOpcs({amdgcn_set_inactive}, StandardB)
2487 .Div(B32, {{VgprB32}, {IntrId, VgprB32, VgprB32}});
2488
2489 addRulesForIOpcs({amdgcn_set_inactive_chain_arg}, Standard)
2490 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
2491
2492 addRulesForIOpcs({amdgcn_cvt_sr_bf16_f32, amdgcn_cvt_sr_f16_f32}, Standard)
2493 .Div(V2S16, {{VgprV2S16}, {IntrId, VgprV2S16, Vgpr32, Vgpr32}});
2494
2495 addRulesForIOpcs({amdgcn_ballot}, Standard)
2496 .Uni(S64, {{Sgpr64}, {IntrId, Vcc}})
2497 .Uni(S32, {{Sgpr32}, {IntrId, Vcc}});
2498
2499 addRulesForIOpcs({amdgcn_inverse_ballot})
2500 .Any({{DivS1, _, S32}, {{Vcc}, {IntrId, SgprB32_ReadFirstLane}}})
2501 .Any({{DivS1, _, S64}, {{Vcc}, {IntrId, SgprB64_ReadFirstLane}}});
2502
2503 addRulesForIOpcs({amdgcn_live_mask, amdgcn_ps_live})
2504 .Any({{DivS1}, {{Vcc}, {}}});
2505
2506 addRulesForIOpcs({amdgcn_mov_dpp, amdgcn_mov_dpp8}, StandardB)
2507 .Div(B32, {{VgprB32}, {IntrId, VgprB32}})
2508 .Div(B64, {{VgprB64}, {IntrId, VgprB64}});
2509
2510 addRulesForIOpcs({amdgcn_update_dpp}, StandardB)
2511 .Div(B32, {{VgprB32}, {IntrId, VgprB32, VgprB32}})
2512 .Div(B64, {{VgprB64}, {IntrId, VgprB64, VgprB64}});
2513
2514 addRulesForIOpcs({amdgcn_sin, amdgcn_cos, amdgcn_tanh}, Standard)
2515 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16}})
2516 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16}})
2517 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}})
2518 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}});
2519
2520 addRulesForIOpcs({amdgcn_trig_preop}, Standard)
2521 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr32}})
2522 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr32}});
2523
2524 addRulesForIOpcs({amdgcn_exp2})
2525 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2526 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2527 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2528 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2529 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2530 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2531 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST);
2532
2533 addRulesForIOpcs({amdgcn_rcp, amdgcn_sqrt})
2534 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2535 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2536 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2537 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2538 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2539 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2540 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST)
2541 .Any({{DivS64}, {{Vgpr64}, {IntrId, Vgpr64}}})
2542 .Any({{UniS64}, {{UniInVgprS64}, {IntrId, Vgpr64}}});
2543
2544 addRulesForIOpcs({amdgcn_log})
2545 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2546 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2547 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2548 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2549 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2550 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2551 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST);
2552
2553 addRulesForIOpcs({amdgcn_ds_atomic_async_barrier_arrive_b64})
2554 .Any({{}, {{}, {IntrId, VgprP3}}});
2555
2556 addRulesForIOpcs({amdgcn_ds_atomic_barrier_arrive_rtn_b64}, Standard)
2557 .Div(S64, {{Vgpr64}, {IntrId, VgprP3, Vgpr64}});
2558
2559 addRulesForIOpcs({amdgcn_ds_add_gs_reg_rtn, amdgcn_ds_sub_gs_reg_rtn},
2560 Standard)
2561 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}})
2562 .Div(S64, {{Vgpr64}, {IntrId, Vgpr32}});
2563
2564 addRulesForIOpcs({amdgcn_ds_append, amdgcn_ds_consume}, Standard)
2565 .Uni(S32, {{UniInVgprS32}, {IntrId, SgprB32_M0}})
2566 .Div(S32, {{Vgpr32}, {IntrId, SgprB32_M0}});
2567
2568 addRulesForIOpcs(
2569 {amdgcn_ds_bvh_stack_rtn, amdgcn_ds_bvh_stack_push4_pop1_rtn}, Standard)
2570 .Div(S32, {{Vgpr32, Vgpr32}, {IntrId, Vgpr32, Vgpr32, VgprV4S32}});
2571
2572 addRulesForIOpcs({amdgcn_ds_bvh_stack_push8_pop1_rtn}, Standard)
2573 .Div(S32, {{Vgpr32, Vgpr32}, {IntrId, Vgpr32, Vgpr32, VgprV8S32}});
2574
2575 addRulesForIOpcs({amdgcn_ds_bvh_stack_push8_pop2_rtn}, Standard)
2576 .Div(S64, {{Vgpr64, Vgpr32}, {IntrId, Vgpr32, Vgpr32, VgprV8S32}});
2577
2578 addRulesForIOpcs({amdgcn_ds_gws_sema_p, amdgcn_ds_gws_sema_v,
2579 amdgcn_ds_gws_sema_release_all})
2580 .Any({{}, {{}, {IntrId, SgprB32_M0}}});
2581
2582 addRulesForIOpcs(
2583 {amdgcn_ds_gws_barrier, amdgcn_ds_gws_init, amdgcn_ds_gws_sema_br})
2584 .Any({{}, {{}, {IntrId, Vgpr32, SgprB32_M0}}});
2585
2586 addRulesForIOpcs({amdgcn_ds_ordered_add, amdgcn_ds_ordered_swap}, Standard)
2587 .Div(S32, {{Vgpr32}, {IntrId, SgprB32_M0, Vgpr32}});
2588
2589 addRulesForIOpcs({amdgcn_ds_swizzle}, Standard)
2590 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}})
2591 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}});
2592
2593 addRulesForIOpcs({amdgcn_permlane16_var, amdgcn_permlanex16_var}, Standard)
2594 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2595
2596 addRulesForIOpcs({amdgcn_permlane16_swap, amdgcn_permlane32_swap}, Standard)
2597 .Div(S32, {{Vgpr32, Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
2598
2599 addRulesForIOpcs({amdgcn_permlane64}, StandardB)
2600 .Div(B32, {{VgprB32}, {IntrId, VgprB32}});
2601
2602 addRulesForIOpcs({amdgcn_ds_read_tr4_b64, amdgcn_ds_read_tr8_b64})
2603 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, VgprP3}}});
2604
2605 addRulesForIOpcs({amdgcn_ds_read_tr6_b96})
2606 .Any({{DivV3S32}, {{VgprV3S32}, {IntrId, VgprP3}}});
2607
2608 addRulesForIOpcs({amdgcn_ds_read_tr16_b64})
2609 .Any({{DivV4S16}, {{VgprV4S16}, {IntrId, VgprP3}}});
2610
2611 addRulesForIOpcs({amdgcn_interp_p1}, Standard)
2612 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Imm, Imm, SgprB32_M0}});
2613
2614 addRulesForIOpcs({amdgcn_interp_p1_f16}, Standard)
2615 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Imm, Imm, Imm, SgprB32_M0}});
2616
2617 addRulesForIOpcs({amdgcn_interp_p2}, Standard)
2618 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Imm, Imm, SgprB32_M0}});
2619
2620 addRulesForIOpcs({amdgcn_interp_p2_f16}, Standard)
2621 .Div(S16,
2623
2624 addRulesForIOpcs({amdgcn_interp_mov}, Standard)
2625 .Div(S32, {{Vgpr32}, {IntrId, Imm, Imm, Imm, SgprB32_M0}});
2626
2627 addRulesForIOpcs({amdgcn_interp_inreg_p10, amdgcn_interp_inreg_p2,
2628 amdgcn_interp_inreg_p10_f16, amdgcn_interp_p10_rtz_f16},
2629 Standard)
2630 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2631 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2632
2633 addRulesForIOpcs({amdgcn_interp_inreg_p2_f16, amdgcn_interp_p2_rtz_f16},
2634 Standard)
2635 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2636 .Div(S16, {{Vgpr16}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2637
2638 addRulesForIOpcs({amdgcn_frexp_exp})
2639 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2640 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2641 .Any({{UniS32, _, S32}, {{UniInVgprS32}, {IntrId, Vgpr32}}})
2642 .Any({{DivS32, _, S32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2643 .Any({{UniS32, _, S64}, {{UniInVgprS32}, {IntrId, Vgpr64}}})
2644 .Any({{DivS32, _, S64}, {{Vgpr32}, {IntrId, Vgpr64}}});
2645
2646 addRulesForIOpcs({amdgcn_div_fmas}, Standard)
2647 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vcc}})
2648 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vcc}})
2649 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr64, Vgpr64, Vcc}})
2650 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr64, Vgpr64, Vcc}});
2651
2652 addRulesForIOpcs({amdgcn_div_fixup}, Standard)
2653 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
2654 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
2655 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2656 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2657 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr64, Vgpr64}})
2658 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr64, Vgpr64}});
2659
2660 addRulesForIOpcs({amdgcn_div_scale}, Standard)
2661 .Div(S32, {{Vgpr32, Vcc}, {IntrId, Vgpr32, Vgpr32}})
2662 .Uni(S32, {{UniInVgprS32, UniInVcc}, {IntrId, Vgpr32, Vgpr32}})
2663 .Div(S64, {{Vgpr64, Vcc}, {IntrId, Vgpr64, Vgpr64}})
2664 .Uni(S64, {{UniInVgprS64, UniInVcc}, {IntrId, Vgpr64, Vgpr64}});
2665
2666 addRulesForIOpcs(
2667 {amdgcn_fdot2, amdgcn_fdot2_f32_bf16, amdgcn_sdot2, amdgcn_udot2},
2668 Standard)
2670 .Div(S32, {{Vgpr32}, {IntrId, VgprV2S16, VgprV2S16, Vgpr32}});
2671
2672 addRulesForIOpcs({amdgcn_fdot2_f16_f16, amdgcn_fdot2_bf16_bf16}, Standard)
2674 .Div(S16, {{Vgpr16}, {IntrId, VgprV2S16, VgprV2S16, Vgpr16}});
2675
2676 addRulesForIOpcs({amdgcn_sudot4, amdgcn_sudot8}, Standard)
2677 .Uni(S32, {{UniInVgprS32}, {IntrId, Imm, Vgpr32, Imm, Vgpr32, Vgpr32}})
2678 .Div(S32, {{Vgpr32}, {IntrId, Imm, Vgpr32, Imm, Vgpr32, Vgpr32}});
2679
2680 addRulesForIOpcs({amdgcn_s_alloc_vgpr})
2682
2683 addRulesForIOpcs({amdgcn_sat_pk4_i4_i8, amdgcn_sat_pk4_u4_u8}, Standard)
2684 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr32}})
2685 .Div(S16, {{Vgpr16}, {IntrId, Vgpr32}});
2686
2687 bool HasGFX90AInsts = ST->hasGFX90AInsts();
2688
2689 // On gfx90a+ both AGPR-form and VGPR-form exists
2690 addRulesForIOpcs({amdgcn_mfma_f32_32x32x1f32, amdgcn_mfma_f32_16x16x1f32,
2691 amdgcn_mfma_f32_4x4x1f32, amdgcn_mfma_f32_32x32x2f32,
2692 amdgcn_mfma_f32_16x16x4f32, amdgcn_mfma_f32_32x32x4f16,
2693 amdgcn_mfma_f32_16x16x4f16, amdgcn_mfma_f32_4x4x4f16,
2694 amdgcn_mfma_f32_32x32x8f16, amdgcn_mfma_f32_16x16x16f16,
2695 amdgcn_mfma_i32_32x32x4i8, amdgcn_mfma_i32_16x16x4i8,
2696 amdgcn_mfma_i32_4x4x4i8, amdgcn_mfma_i32_32x32x8i8,
2697 amdgcn_mfma_i32_16x16x16i8, amdgcn_mfma_f32_32x32x2bf16,
2698 amdgcn_mfma_f32_16x16x2bf16, amdgcn_mfma_f32_4x4x2bf16,
2699 amdgcn_mfma_f32_32x32x4bf16, amdgcn_mfma_f32_16x16x8bf16})
2700 .Any({{DivAnyTy},
2702 !HasGFX90AInsts)
2703 .Any({{DivAnyTy},
2704 {{VgprOrAgprAnyTy},
2706 HasGFX90AInsts);
2707
2708 // gfx90a+ only MFMAs
2709 addRulesForIOpcs({
2710 amdgcn_mfma_f32_32x32x4bf16_1k,
2711 amdgcn_mfma_f32_16x16x4bf16_1k,
2712 amdgcn_mfma_f32_4x4x4bf16_1k,
2713 amdgcn_mfma_f32_32x32x8bf16_1k,
2714 amdgcn_mfma_f32_16x16x16bf16_1k,
2715 amdgcn_mfma_f64_16x16x4f64,
2716 amdgcn_mfma_f64_4x4x4f64,
2717 amdgcn_mfma_i32_16x16x32_i8,
2718 amdgcn_mfma_i32_32x32x16_i8,
2719 amdgcn_mfma_f32_16x16x8_xf32,
2720 amdgcn_mfma_f32_32x32x4_xf32,
2721 amdgcn_mfma_f32_16x16x32_bf8_bf8,
2722 amdgcn_mfma_f32_16x16x32_bf8_fp8,
2723 amdgcn_mfma_f32_16x16x32_fp8_bf8,
2724 amdgcn_mfma_f32_16x16x32_fp8_fp8,
2725 amdgcn_mfma_f32_32x32x16_bf8_bf8,
2726 amdgcn_mfma_f32_32x32x16_bf8_fp8,
2727 amdgcn_mfma_f32_32x32x16_fp8_bf8,
2728 amdgcn_mfma_f32_32x32x16_fp8_fp8,
2729 // gfx950
2730 amdgcn_mfma_f32_16x16x32_f16,
2731 amdgcn_mfma_f32_32x32x16_f16,
2732 amdgcn_mfma_i32_16x16x64_i8,
2733 amdgcn_mfma_i32_32x32x32_i8,
2734 amdgcn_mfma_f32_16x16x32_bf16,
2735 amdgcn_mfma_f32_32x32x16_bf16,
2736 })
2737 .Any({{DivAnyTy},
2738 {{VgprOrAgprAnyTy},
2740
2741 addRulesForIOpcs(
2742 {// gfx942+
2743 amdgcn_smfmac_f32_16x16x32_f16, amdgcn_smfmac_f32_32x32x16_f16,
2744 amdgcn_smfmac_f32_16x16x32_bf16, amdgcn_smfmac_f32_32x32x16_bf16,
2745 amdgcn_smfmac_i32_16x16x64_i8, amdgcn_smfmac_i32_32x32x32_i8,
2746 amdgcn_smfmac_f32_16x16x64_bf8_bf8, amdgcn_smfmac_f32_16x16x64_bf8_fp8,
2747 amdgcn_smfmac_f32_16x16x64_fp8_bf8, amdgcn_smfmac_f32_16x16x64_fp8_fp8,
2748 amdgcn_smfmac_f32_32x32x32_bf8_bf8, amdgcn_smfmac_f32_32x32x32_bf8_fp8,
2749 amdgcn_smfmac_f32_32x32x32_fp8_bf8, amdgcn_smfmac_f32_32x32x32_fp8_fp8,
2750 // gfx950+
2751 amdgcn_smfmac_f32_16x16x64_f16, amdgcn_smfmac_f32_32x32x32_f16,
2752 amdgcn_smfmac_f32_16x16x64_bf16, amdgcn_smfmac_f32_32x32x32_bf16,
2753 amdgcn_smfmac_i32_16x16x128_i8, amdgcn_smfmac_i32_32x32x64_i8,
2754 amdgcn_smfmac_f32_16x16x128_bf8_bf8, amdgcn_smfmac_f32_16x16x128_bf8_fp8,
2755 amdgcn_smfmac_f32_16x16x128_fp8_bf8, amdgcn_smfmac_f32_16x16x128_fp8_fp8,
2756 amdgcn_smfmac_f32_32x32x64_bf8_bf8, amdgcn_smfmac_f32_32x32x64_bf8_fp8,
2757 amdgcn_smfmac_f32_32x32x64_fp8_bf8, amdgcn_smfmac_f32_32x32x64_fp8_fp8})
2758 .Any({{DivAnyTy},
2759 {{VgprOrAgprAnyTy},
2761
2762 addRulesForIOpcs({amdgcn_mfma_scale_f32_32x32x64_f8f6f4,
2763 amdgcn_mfma_scale_f32_16x16x128_f8f6f4})
2764 .Any({{DivAnyTy},
2765 {{VgprOrAgprAnyTy},
2767 Vgpr32, Imm, Vgpr32}}});
2768
2769 // WMMA/SWMMAC intrinsics: all register operands map to VGPR.
2770 addRulesForIOpcs(
2771 {// WMMA GFX11+
2772 amdgcn_wmma_f32_16x16x16_f16, amdgcn_wmma_f32_16x16x16_bf16,
2773 amdgcn_wmma_f16_16x16x16_f16, amdgcn_wmma_bf16_16x16x16_bf16,
2774 amdgcn_wmma_f16_16x16x16_f16_tied, amdgcn_wmma_bf16_16x16x16_bf16_tied,
2775 amdgcn_wmma_i32_16x16x16_iu8, amdgcn_wmma_i32_16x16x16_iu4,
2776 // WMMA GFX12
2777 amdgcn_wmma_f32_16x16x16_fp8_fp8, amdgcn_wmma_f32_16x16x16_fp8_bf8,
2778 amdgcn_wmma_f32_16x16x16_bf8_fp8, amdgcn_wmma_f32_16x16x16_bf8_bf8,
2779 amdgcn_wmma_i32_16x16x32_iu4,
2780 // WMMA GFX1250
2781 amdgcn_wmma_f32_16x16x4_f32, amdgcn_wmma_f32_16x16x32_bf16,
2782 amdgcn_wmma_f32_16x16x32_f16, amdgcn_wmma_f16_16x16x32_f16,
2783 amdgcn_wmma_bf16_16x16x32_bf16, amdgcn_wmma_bf16f32_16x16x32_bf16,
2784 amdgcn_wmma_f32_16x16x64_fp8_fp8, amdgcn_wmma_f32_16x16x64_fp8_bf8,
2785 amdgcn_wmma_f32_16x16x64_bf8_fp8, amdgcn_wmma_f32_16x16x64_bf8_bf8,
2786 amdgcn_wmma_f16_16x16x64_fp8_fp8, amdgcn_wmma_f16_16x16x64_fp8_bf8,
2787 amdgcn_wmma_f16_16x16x64_bf8_fp8, amdgcn_wmma_f16_16x16x64_bf8_bf8,
2788 amdgcn_wmma_f16_16x16x128_fp8_fp8, amdgcn_wmma_f16_16x16x128_fp8_bf8,
2789 amdgcn_wmma_f16_16x16x128_bf8_fp8, amdgcn_wmma_f16_16x16x128_bf8_bf8,
2790 amdgcn_wmma_f32_16x16x128_fp8_fp8, amdgcn_wmma_f32_16x16x128_fp8_bf8,
2791 amdgcn_wmma_f32_16x16x128_bf8_fp8, amdgcn_wmma_f32_16x16x128_bf8_bf8,
2792 amdgcn_wmma_i32_16x16x64_iu8, amdgcn_wmma_f32_16x16x128_f8f6f4,
2793 amdgcn_wmma_scale_f32_16x16x128_f8f6f4,
2794 amdgcn_wmma_scale16_f32_16x16x128_f8f6f4, amdgcn_wmma_f32_32x16x128_f4,
2795 amdgcn_wmma_scale_f32_32x16x128_f4, amdgcn_wmma_scale16_f32_32x16x128_f4,
2796 // WMMA GFX1251
2797 amdgcn_wmma_f64_16x16x4_f64,
2798 // SWMMAC GFX12
2799 amdgcn_swmmac_f32_16x16x32_f16, amdgcn_swmmac_f32_16x16x32_bf16,
2800 amdgcn_swmmac_f16_16x16x32_f16, amdgcn_swmmac_bf16_16x16x32_bf16,
2801 amdgcn_swmmac_i32_16x16x32_iu8, amdgcn_swmmac_i32_16x16x32_iu4,
2802 amdgcn_swmmac_i32_16x16x64_iu4, amdgcn_swmmac_f32_16x16x32_fp8_fp8,
2803 amdgcn_swmmac_f32_16x16x32_fp8_bf8, amdgcn_swmmac_f32_16x16x32_bf8_fp8,
2804 amdgcn_swmmac_f32_16x16x32_bf8_bf8,
2805 // SWMMAC GFX1250
2806 amdgcn_swmmac_f32_16x16x64_f16, amdgcn_swmmac_f32_16x16x64_bf16,
2807 amdgcn_swmmac_f16_16x16x64_f16, amdgcn_swmmac_bf16_16x16x64_bf16,
2808 amdgcn_swmmac_bf16f32_16x16x64_bf16, amdgcn_swmmac_f32_16x16x128_fp8_fp8,
2809 amdgcn_swmmac_f32_16x16x128_fp8_bf8, amdgcn_swmmac_f32_16x16x128_bf8_fp8,
2810 amdgcn_swmmac_f32_16x16x128_bf8_bf8, amdgcn_swmmac_f16_16x16x128_fp8_fp8,
2811 amdgcn_swmmac_f16_16x16x128_fp8_bf8, amdgcn_swmmac_f16_16x16x128_bf8_fp8,
2812 amdgcn_swmmac_f16_16x16x128_bf8_bf8, amdgcn_swmmac_i32_16x16x128_iu8})
2813 .Any({{}, {{}, {}, ApplyAllVgpr}});
2814
2815} // end initialize rules
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
AMDGPU address space definition.
Contains the definition of a TargetInstrInfo class that is common to all AMD GPUs.
constexpr LLT S16
constexpr LLT S1
constexpr LLT V2S16
constexpr LLT S32
constexpr LLT V4S32
constexpr LLT V3S32
constexpr LLT S64
constexpr LLT V2S32
constexpr LLT S128
UniformityLLTOpPredicateID LLTToBId(LLT Ty)
bool matchUniformityAndLLT(Register Reg, UniformityLLTOpPredicateID UniID, const MachineUniformityInfo &MUI, const MachineRegisterInfo &MRI)
UniformityLLTOpPredicateID LLTToId(LLT Ty)
AMD GCN specific subclass of TargetSubtarget.
Declares convenience wrapper classes for interpreting MachineInstr instances as specific generic oper...
#define _
IRTranslator LLVM IR MI
Register Reg
Register const TargetRegisterInfo * TRI
Machine IR instance of the generic uniformity analysis.
bool operator()(const MachineInstr &MI) const
Predicate operator||(const Predicate &RHS) const
Predicate operator&&(const Predicate &RHS) const
Predicate(std::function< bool(const MachineInstr &)> Pred)
Predicate operator!() const
RegBankLegalizeRules(const GCNSubtarget &ST, MachineRegisterInfo &MRI)
const SetOfRulesForOpcode * getRulesForOpc(MachineInstr &MI) const
const RegBankLLTMapping * findMappingForMI(const MachineInstr &MI, const MachineRegisterInfo &MRI, const MachineUniformityInfo &MUI) const
void addFastRuleDivergent(UniformityLLTOpPredicateID Ty, RegBankLLTMapping RuleApplyIDs)
void addFastRuleUniform(UniformityLLTOpPredicateID Ty, RegBankLLTMapping RuleApplyIDs)
Predicate
This enumeration lists the possible predicates for CmpInst subclasses.
Definition InstrTypes.h:740
bool isSigned() const
Definition InstrTypes.h:993
bool isDivergentAtDef(ConstValueRefT V) const
Whether V is divergent at its definition.
bool isUniformAtDef(ConstValueRefT V) const
Whether V is uniform/non-divergent at its definition.
bool isEquality() const
Return true if this predicate is either EQ or NE.
static constexpr LLT scalar(unsigned SizeInBits)
Get a low-level scalar or aggregate "bag of bits".
bool isBFloat16() const
static constexpr LLT pointer(unsigned AddressSpace, unsigned SizeInBits)
Get a low-level pointer in the given address space.
constexpr TypeSize getSizeInBits() const
Returns the total size of the type. Must only be called on sized types.
static constexpr LLT fixed_vector(unsigned NumElements, unsigned ScalarSizeInBits)
Get a low-level fixed-width vector of some number of elements and element width.
TypeSize getValue() const
Representation of each machine instruction.
A description of a memory reference used in the backend.
LocationSize getSize() const
Return the size in bytes of the memory reference.
unsigned getAddrSpace() const
LLVM_ABI Align getAlign() const
Return the minimum known alignment in bytes of the actual memory reference.
MachineOperand class - Representation of each machine instruction operand.
bool isReg() const
isReg - Tests if this is a MO_Register operand.
Register getReg() const
getReg - Returns the register number.
MachineRegisterInfo - Keep track of information for virtual and physical registers,...
LLT getType(Register Reg) const
Get the low-level type of Reg or LLT{} if Reg is not a generic (target independent) virtual register.
const TargetRegisterInfo * getTargetRegisterInfo() const
Wrapper class representing virtual and physical registers.
Definition Register.h:20
This class consists of common code factored out of the SmallVector class to reduce code duplication b...
void append(ItTy in_start, ItTy in_end)
Add the specified range to the end of the SmallVector.
void swap(SmallVectorImpl &RHS)
void push_back(const T &Elt)
This is a 'vector' (really, a variable-sized array), optimized for the case when the array is small.
#define llvm_unreachable(msg)
Marks that the current location is not supposed to be reachable.
@ CONSTANT_ADDRESS_32BIT
Address space for 32-bit constant memory.
@ CONSTANT_ADDRESS
Address space for constant memory (VTX2).
bool isAnyPtr(LLT Ty, unsigned Width)
bool isUniformMMO(const MachineMemOperand *MMO)
This namespace contains an enum with a value for every intrinsic/builtin function known by LLVM.
This is an optimization pass for GlobalISel generic memory operations.
GenericUniformityInfo< MachineSSAContext > MachineUniformityInfo
static const MachineMemOperand::Flags MONoClobber
Mark the MMO of a uniform load if there are no potentially clobbering stores on any path from the sta...
Definition SIInstrInfo.h:46
decltype(auto) cast(const From &Val)
cast<X> - Return the argument parameter cast to the specified type.
Definition Casting.h:559
SmallVector< UniformityLLTOpPredicateID, 4 > OpUniformityAndTypes
PredicateMapping(std::initializer_list< UniformityLLTOpPredicateID > OpList, std::function< bool(const MachineInstr &)> TestFunc=nullptr)
bool match(const MachineInstr &MI, const MachineUniformityInfo &MUI, const MachineRegisterInfo &MRI) const
std::function< bool(const MachineInstr &)> TestFunc
RegBankLLTMapping(std::initializer_list< RegBankLLTMappingApplyID > DstOpMappingList, std::initializer_list< RegBankLLTMappingApplyID > SrcOpMappingList, LoweringMethodID LoweringMethod=DoNotLower)
SmallVector< RegBankLLTMappingApplyID, 2 > DstOpMapping
SmallVector< RegBankLLTMappingApplyID, 4 > SrcOpMapping
This struct is a compact representation of a valid (non-zero power of two) alignment.
Definition Alignment.h:39