LLVM 24.0.0git
AMDGPURegBankLegalizeRules.cpp
Go to the documentation of this file.
1//===-- AMDGPURegBankLegalizeRules.cpp ------------------------------------===//
2//
3// Part of the LLVM Project, under the Apache License v2.0 with LLVM Exceptions.
4// See https://llvm.org/LICENSE.txt for license information.
5// SPDX-License-Identifier: Apache-2.0 WITH LLVM-exception
6//
7//===----------------------------------------------------------------------===//
8//
9/// Definitions of RegBankLegalize Rules for all opcodes.
10/// Implementation of container for all the Rules and search.
11/// Fast search for most common case when Rule.Predicate checks LLT and
12/// uniformity of register in operand 0.
13//
14//===----------------------------------------------------------------------===//
15
17#include "AMDGPUInstrInfo.h"
18#include "GCNSubtarget.h"
21#include "llvm/IR/IntrinsicsAMDGPU.h"
23
24#define DEBUG_TYPE "amdgpu-reg-bank-legalize"
25
26using namespace llvm;
27using namespace AMDGPU;
28
29bool AMDGPU::isAnyPtr(LLT Ty, unsigned Width) {
30 return Ty.isPointer() && Ty.getSizeInBits() == Width;
31}
32
34 std::initializer_list<RegBankLLTMappingApplyID> DstOpMappingList,
35 std::initializer_list<RegBankLLTMappingApplyID> SrcOpMappingList,
37 : DstOpMapping(DstOpMappingList), SrcOpMapping(SrcOpMappingList),
39
41 std::initializer_list<UniformityLLTOpPredicateID> OpList,
42 std::function<bool(const MachineInstr &)> TestFunc)
44
46 const MachineUniformityInfo &MUI,
47 const MachineRegisterInfo &MRI) {
48 switch (UniID) {
49 case S1:
50 return MRI.getType(Reg) == LLT::scalar(1);
51 case S16:
52 return MRI.getType(Reg) == LLT::scalar(16);
53 case S32:
54 return MRI.getType(Reg) == LLT::scalar(32);
55 case S64:
56 return MRI.getType(Reg) == LLT::scalar(64);
57 case S128:
58 return MRI.getType(Reg) == LLT::scalar(128);
59 case P0:
60 return MRI.getType(Reg) == LLT::pointer(0, 64);
61 case P1:
62 return MRI.getType(Reg) == LLT::pointer(1, 64);
63 case P2:
64 return MRI.getType(Reg) == LLT::pointer(2, 32);
65 case P3:
66 return MRI.getType(Reg) == LLT::pointer(3, 32);
67 case P4:
68 return MRI.getType(Reg) == LLT::pointer(4, 64);
69 case P5:
70 return MRI.getType(Reg) == LLT::pointer(5, 32);
71 case P8:
72 return MRI.getType(Reg) == LLT::pointer(8, 128);
73 case Ptr32:
74 return isAnyPtr(MRI.getType(Reg), 32);
75 case Ptr64:
76 return isAnyPtr(MRI.getType(Reg), 64);
77 case Ptr128:
78 return isAnyPtr(MRI.getType(Reg), 128);
79 case V2S16:
80 return MRI.getType(Reg) == LLT::fixed_vector(2, 16);
81 case V2S32:
82 return MRI.getType(Reg) == LLT::fixed_vector(2, 32);
83 case V3S32:
84 return MRI.getType(Reg) == LLT::fixed_vector(3, 32);
85 case V4S32:
86 return MRI.getType(Reg) == LLT::fixed_vector(4, 32);
87 case B32:
88 return MRI.getType(Reg).getSizeInBits() == 32;
89 case B64:
90 return MRI.getType(Reg).getSizeInBits() == 64;
91 case B96:
92 return MRI.getType(Reg).getSizeInBits() == 96;
93 case B128:
94 return MRI.getType(Reg).getSizeInBits() == 128;
95 case B160:
96 return MRI.getType(Reg).getSizeInBits() == 160;
97 case B256:
98 return MRI.getType(Reg).getSizeInBits() == 256;
99 case B512:
100 return MRI.getType(Reg).getSizeInBits() == 512;
101 case DivAnyTy:
102 return MUI.isDivergentAtDef(Reg);
103 case UniS1:
104 return MRI.getType(Reg) == LLT::scalar(1) && MUI.isUniformAtDef(Reg);
105 case UniS16:
106 return MRI.getType(Reg) == LLT::scalar(16) && MUI.isUniformAtDef(Reg);
107 case UniS32:
108 return MRI.getType(Reg) == LLT::scalar(32) && MUI.isUniformAtDef(Reg);
109 case UniS64:
110 return MRI.getType(Reg) == LLT::scalar(64) && MUI.isUniformAtDef(Reg);
111 case UniS128:
112 return MRI.getType(Reg) == LLT::scalar(128) && MUI.isUniformAtDef(Reg);
113 case UniBF16:
114 return MRI.getType(Reg).isBFloat16() && MUI.isUniformAtDef(Reg);
115 case UniP0:
116 return MRI.getType(Reg) == LLT::pointer(0, 64) && MUI.isUniformAtDef(Reg);
117 case UniP1:
118 return MRI.getType(Reg) == LLT::pointer(1, 64) && MUI.isUniformAtDef(Reg);
119 case UniP2:
120 return MRI.getType(Reg) == LLT::pointer(2, 32) && MUI.isUniformAtDef(Reg);
121 case UniP3:
122 return MRI.getType(Reg) == LLT::pointer(3, 32) && MUI.isUniformAtDef(Reg);
123 case UniP4:
124 return MRI.getType(Reg) == LLT::pointer(4, 64) && MUI.isUniformAtDef(Reg);
125 case UniP5:
126 return MRI.getType(Reg) == LLT::pointer(5, 32) && MUI.isUniformAtDef(Reg);
127 case UniP6:
128 return MRI.getType(Reg) == LLT::pointer(6, 32) && MUI.isUniformAtDef(Reg);
129 case UniP8:
130 return MRI.getType(Reg) == LLT::pointer(8, 128) && MUI.isUniformAtDef(Reg);
131 case UniPtr32:
132 return isAnyPtr(MRI.getType(Reg), 32) && MUI.isUniformAtDef(Reg);
133 case UniPtr64:
134 return isAnyPtr(MRI.getType(Reg), 64) && MUI.isUniformAtDef(Reg);
135 case UniPtr128:
136 return isAnyPtr(MRI.getType(Reg), 128) && MUI.isUniformAtDef(Reg);
137 case UniV2S16:
138 return MRI.getType(Reg) == LLT::fixed_vector(2, 16) &&
139 MUI.isUniformAtDef(Reg);
140 case UniV2S32:
141 return MRI.getType(Reg) == LLT::fixed_vector(2, 32) &&
142 MUI.isUniformAtDef(Reg);
143 case UniV3S32:
144 return MRI.getType(Reg) == LLT::fixed_vector(3, 32) &&
145 MUI.isUniformAtDef(Reg);
146 case UniV4S32:
147 return MRI.getType(Reg) == LLT::fixed_vector(4, 32) &&
148 MUI.isUniformAtDef(Reg);
149 case UniV6S32:
150 return MRI.getType(Reg) == LLT::fixed_vector(6, 32) &&
151 MUI.isUniformAtDef(Reg);
152 case UniV8S16:
153 return MRI.getType(Reg) == LLT::fixed_vector(8, 16) &&
154 MUI.isUniformAtDef(Reg);
155 case UniV8S32:
156 return MRI.getType(Reg) == LLT::fixed_vector(8, 32) &&
157 MUI.isUniformAtDef(Reg);
158 case UniV16S16:
159 return MRI.getType(Reg) == LLT::fixed_vector(16, 16) &&
160 MUI.isUniformAtDef(Reg);
161 case UniV16S32:
162 return MRI.getType(Reg) == LLT::fixed_vector(16, 32) &&
163 MUI.isUniformAtDef(Reg);
164 case UniV32S16:
165 return MRI.getType(Reg) == LLT::fixed_vector(32, 16) &&
166 MUI.isUniformAtDef(Reg);
167 case UniV32S32:
168 return MRI.getType(Reg) == LLT::fixed_vector(32, 32) &&
169 MUI.isUniformAtDef(Reg);
170 case UniV2S64:
171 return MRI.getType(Reg) == LLT::fixed_vector(2, 64) &&
172 MUI.isUniformAtDef(Reg);
173 case UniB32:
174 return MRI.getType(Reg).getSizeInBits() == 32 && MUI.isUniformAtDef(Reg);
175 case UniB64:
176 return MRI.getType(Reg).getSizeInBits() == 64 && MUI.isUniformAtDef(Reg);
177 case UniB96:
178 return MRI.getType(Reg).getSizeInBits() == 96 && MUI.isUniformAtDef(Reg);
179 case UniB128:
180 return MRI.getType(Reg).getSizeInBits() == 128 && MUI.isUniformAtDef(Reg);
181 case UniB160:
182 return MRI.getType(Reg).getSizeInBits() == 160 && MUI.isUniformAtDef(Reg);
183 case UniB256:
184 return MRI.getType(Reg).getSizeInBits() == 256 && MUI.isUniformAtDef(Reg);
185 case UniB512:
186 return MRI.getType(Reg).getSizeInBits() == 512 && MUI.isUniformAtDef(Reg);
187 case UniBRC: {
188 if (MUI.isDivergentAtDef(Reg))
189 return false;
190 // Check if there is SGPR register class of same size as the LLT.
191 const SIRegisterInfo *TRI =
192 static_cast<const SIRegisterInfo *>(MRI.getTargetRegisterInfo());
193 // There is no 16 bit SGPR register class. Extra size check is required
194 // since getSGPRClassForBitWidth returns SReg_32RegClass for Size 16.
195 unsigned LLTSize = MRI.getType(Reg).getSizeInBits();
196 return LLTSize >= 32 && TRI->getSGPRClassForBitWidth(LLTSize);
197 }
198 case DivS1:
199 return MRI.getType(Reg) == LLT::scalar(1) && MUI.isDivergentAtDef(Reg);
200 case DivS16:
201 return MRI.getType(Reg) == LLT::scalar(16) && MUI.isDivergentAtDef(Reg);
202 case DivS32:
203 return MRI.getType(Reg) == LLT::scalar(32) && MUI.isDivergentAtDef(Reg);
204 case DivS64:
205 return MRI.getType(Reg) == LLT::scalar(64) && MUI.isDivergentAtDef(Reg);
206 case DivS128:
207 return MRI.getType(Reg) == LLT::scalar(128) && MUI.isDivergentAtDef(Reg);
208 case DivP0:
209 return MRI.getType(Reg) == LLT::pointer(0, 64) && MUI.isDivergentAtDef(Reg);
210 case DivP1:
211 return MRI.getType(Reg) == LLT::pointer(1, 64) && MUI.isDivergentAtDef(Reg);
212 case DivP2:
213 return MRI.getType(Reg) == LLT::pointer(2, 32) && MUI.isDivergentAtDef(Reg);
214 case DivP3:
215 return MRI.getType(Reg) == LLT::pointer(3, 32) && MUI.isDivergentAtDef(Reg);
216 case DivP4:
217 return MRI.getType(Reg) == LLT::pointer(4, 64) && MUI.isDivergentAtDef(Reg);
218 case DivP5:
219 return MRI.getType(Reg) == LLT::pointer(5, 32) && MUI.isDivergentAtDef(Reg);
220 case DivPtr32:
221 return isAnyPtr(MRI.getType(Reg), 32) && MUI.isDivergentAtDef(Reg);
222 case DivPtr64:
223 return isAnyPtr(MRI.getType(Reg), 64) && MUI.isDivergentAtDef(Reg);
224 case DivPtr128:
225 return isAnyPtr(MRI.getType(Reg), 128) && MUI.isDivergentAtDef(Reg);
226 case DivV2S16:
227 return MRI.getType(Reg) == LLT::fixed_vector(2, 16) &&
229 case DivV2S32:
230 return MRI.getType(Reg) == LLT::fixed_vector(2, 32) &&
232 case DivV4S32:
233 return MRI.getType(Reg) == LLT::fixed_vector(4, 32) &&
235 case DivV2S64:
236 return MRI.getType(Reg) == LLT::fixed_vector(2, 64) &&
238 case DivV3S32:
239 return MRI.getType(Reg) == LLT::fixed_vector(3, 32) &&
241 case DivV4S16:
242 return MRI.getType(Reg) == LLT::fixed_vector(4, 16) &&
244 case DivV8S16:
245 return MRI.getType(Reg) == LLT::fixed_vector(8, 16) &&
247 case DivV8S32:
248 return MRI.getType(Reg) == LLT::fixed_vector(8, 32) &&
250 case DivV16S16:
251 return MRI.getType(Reg) == LLT::fixed_vector(16, 16) &&
253 case DivV16S32:
254 return MRI.getType(Reg) == LLT::fixed_vector(16, 32) &&
256 case DivV6S32:
257 return MRI.getType(Reg) == LLT::fixed_vector(6, 32) &&
259 case DivV32S16:
260 return MRI.getType(Reg) == LLT::fixed_vector(32, 16) &&
262 case DivV32S32:
263 return MRI.getType(Reg) == LLT::fixed_vector(32, 32) &&
265 case DivB32:
266 return MRI.getType(Reg).getSizeInBits() == 32 && MUI.isDivergentAtDef(Reg);
267 case DivB64:
268 return MRI.getType(Reg).getSizeInBits() == 64 && MUI.isDivergentAtDef(Reg);
269 case DivB96:
270 return MRI.getType(Reg).getSizeInBits() == 96 && MUI.isDivergentAtDef(Reg);
271 case DivB128:
272 return MRI.getType(Reg).getSizeInBits() == 128 && MUI.isDivergentAtDef(Reg);
273 case DivB160:
274 return MRI.getType(Reg).getSizeInBits() == 160 && MUI.isDivergentAtDef(Reg);
275 case DivB256:
276 return MRI.getType(Reg).getSizeInBits() == 256 && MUI.isDivergentAtDef(Reg);
277 case DivB512:
278 return MRI.getType(Reg).getSizeInBits() == 512 && MUI.isDivergentAtDef(Reg);
279 case DivBRC: {
280 if (MUI.isUniformAtDef(Reg))
281 return false;
282 // Check if there is VGPR register class of same size as the LLT.
283 const SIRegisterInfo *TRI =
284 static_cast<const SIRegisterInfo *>(MRI.getTargetRegisterInfo());
285 return TRI->getSGPRClassForBitWidth(MRI.getType(Reg).getSizeInBits());
286 }
287 case BRC: {
288 // Check if there is SGPR and VGPR register class of same size as the LLT.
289 const SIRegisterInfo *TRI =
290 static_cast<const SIRegisterInfo *>(MRI.getTargetRegisterInfo());
291 unsigned LLTSize = MRI.getType(Reg).getSizeInBits();
292 return LLTSize >= 32 && TRI->getSGPRClassForBitWidth(LLTSize) &&
293 TRI->getVGPRClassForBitWidth(LLTSize);
294 }
295 case _:
296 return true;
297 default:
298 llvm_unreachable("missing matchUniformityAndLLT");
299 }
300}
301
303 const MachineUniformityInfo &MUI,
304 const MachineRegisterInfo &MRI) const {
305 // Check LLT signature.
306 for (unsigned i = 0; i < OpUniformityAndTypes.size(); ++i) {
307 const MachineOperand &MO = MI.getOperand(i);
308 if (OpUniformityAndTypes[i] == _) {
309 assert((!MI.getOperand(i).isReg() ||
310 !MI.getOperand(i).getReg().isVirtual()) &&
311 "_ is for non-register and physical register operands only");
312 continue;
313 }
314
315 // Remaining IDs check registers.
316 if (!MO.isReg())
317 return false;
318
319 if (!matchUniformityAndLLT(MO.getReg(), OpUniformityAndTypes[i], MUI, MRI))
320 return false;
321 }
322
323 // More complex check.
324 if (TestFunc)
325 return TestFunc(MI);
326
327 return true;
328}
329
331
333 : FastTypes(FastTypes) {}
334
336 if (Ty == LLT::scalar(16))
337 return S16;
338 if (Ty == LLT::scalar(32))
339 return S32;
340 if (Ty == LLT::scalar(64))
341 return S64;
342 if (Ty == LLT::fixed_vector(2, 16))
343 return V2S16;
344 if (Ty == LLT::fixed_vector(2, 32))
345 return V2S32;
346 if (Ty == LLT::fixed_vector(3, 32))
347 return V3S32;
348 if (Ty == LLT::fixed_vector(4, 32))
349 return V4S32;
350 return _;
351}
352
354 if (Ty == LLT::scalar(32) || Ty == LLT::fixed_vector(2, 16) ||
355 isAnyPtr(Ty, 32))
356 return B32;
357 if (Ty == LLT::scalar(64) || Ty == LLT::fixed_vector(2, 32) ||
358 Ty == LLT::fixed_vector(4, 16) || isAnyPtr(Ty, 64))
359 return B64;
360 if (Ty == LLT::fixed_vector(3, 32))
361 return B96;
362 if (Ty == LLT::fixed_vector(4, 32) || Ty == LLT::fixed_vector(2, 64) ||
363 Ty == LLT::fixed_vector(8, 16) || isAnyPtr(Ty, 128))
364 return B128;
365 return _;
366}
367
368const RegBankLLTMapping *
370 const MachineRegisterInfo &MRI,
371 const MachineUniformityInfo &MUI) const {
372 // Search in "Fast Rules".
373 // Note: if fast rules are enabled, RegBankLLTMapping must be added in each
374 // slot that could "match fast Predicate". If not, InvalidMapping is
375 // returned which results in failure, does not search "Slow Rules".
376 if (FastTypes != NoFastRules) {
377 Register Reg = MI.getOperand(0).getReg();
378 int Slot;
379 if (FastTypes == StandardB)
380 Slot = getFastPredicateSlot(LLTToBId(MRI.getType(Reg)));
381 else
382 Slot = getFastPredicateSlot(LLTToId(MRI.getType(Reg)));
383
384 if (Slot != -1)
385 return MUI.isUniformAtDef(Reg) ? &Uni[Slot] : &Div[Slot];
386 }
387
388 // Slow search for more complex rules.
389 for (const RegBankLegalizeRule &Rule : Rules) {
390 if (Rule.Predicate.match(MI, MUI, MRI))
391 return &Rule.OperandMapping;
392 }
393
394 return nullptr;
395}
396
398 Rules.push_back(Rule);
399}
400
402 RegBankLLTMapping RuleApplyIDs) {
403 int Slot = getFastPredicateSlot(Ty);
404 assert(Slot != -1 && "Ty unsupported in this FastRulesTypes");
405 Div[Slot] = std::move(RuleApplyIDs);
406}
407
409 RegBankLLTMapping RuleApplyIDs) {
410 int Slot = getFastPredicateSlot(Ty);
411 assert(Slot != -1 && "Ty unsupported in this FastRulesTypes");
412 Uni[Slot] = std::move(RuleApplyIDs);
413}
414
415int SetOfRulesForOpcode::getFastPredicateSlot(
417 switch (FastTypes) {
418 case Standard: {
419 switch (Ty) {
420 case S32:
421 return 0;
422 case S16:
423 return 1;
424 case S64:
425 return 2;
426 case V2S16:
427 return 3;
428 default:
429 return -1;
430 }
431 }
432 case StandardB: {
433 switch (Ty) {
434 case B32:
435 return 0;
436 case B64:
437 return 1;
438 case B96:
439 return 2;
440 case B128:
441 return 3;
442 default:
443 return -1;
444 }
445 }
446 case Vector: {
447 switch (Ty) {
448 case S32:
449 return 0;
450 case V2S32:
451 return 1;
452 case V3S32:
453 return 2;
454 case V4S32:
455 return 3;
456 default:
457 return -1;
458 }
459 }
460 default:
461 return -1;
462 }
463}
464
465RegBankLegalizeRules::RuleSetInitializer
466RegBankLegalizeRules::addRulesForGOpcs(std::initializer_list<unsigned> OpcList,
467 FastRulesTypes FastTypes) {
468 return RuleSetInitializer(OpcList, GRulesAlias, GRules, FastTypes);
469}
470
471RegBankLegalizeRules::RuleSetInitializer
472RegBankLegalizeRules::addRulesForIOpcs(std::initializer_list<unsigned> OpcList,
473 FastRulesTypes FastTypes) {
474 return RuleSetInitializer(OpcList, IRulesAlias, IRules, FastTypes);
475}
476
479 unsigned Opc = MI.getOpcode();
480 if (Opc == AMDGPU::G_INTRINSIC || Opc == AMDGPU::G_INTRINSIC_CONVERGENT ||
481 Opc == AMDGPU::G_INTRINSIC_W_SIDE_EFFECTS ||
482 Opc == AMDGPU::G_INTRINSIC_CONVERGENT_W_SIDE_EFFECTS) {
483 unsigned IntrID = cast<GIntrinsic>(MI).getIntrinsicID();
484 auto IRAIt = IRulesAlias.find(IntrID);
485 if (IRAIt == IRulesAlias.end())
486 return nullptr;
487 return &IRules.at(IRAIt->second);
488 }
489
490 auto GRAIt = GRulesAlias.find(Opc);
491 if (GRAIt == GRulesAlias.end())
492 return nullptr;
493 return &GRules.at(GRAIt->second);
494}
495
496// Syntactic sugar wrapper for predicate lambda that enables '&&', '||' and '!'.
497class Predicate {
498private:
499 struct Elt {
500 // Save formula composed of Pred, '&&', '||' and '!' as a jump table.
501 // Sink ! to Pred. For example !((A && !B) || C) -> (!A || B) && !C
502 // Sequences of && and || will be represented by jumps, for example:
503 // (A && B && ... X) or (A && B && ... X) || Y
504 // A == true jump to B
505 // A == false jump to end or Y, result is A(false) or Y
506 // (A || B || ... X) or (A || B || ... X) && Y
507 // A == true jump to end or Y, result is A(true) or Y
508 // A == false jump to B
509 // Notice that when negating expression, we simply flip Neg on each Pred
510 // and swap TJumpOffset and FJumpOffset (&& becomes ||, || becomes &&).
511 std::function<bool(const MachineInstr &)> Pred;
512 bool Neg; // Neg of Pred is calculated before jump
513 unsigned TJumpOffset;
514 unsigned FJumpOffset;
515 };
516
517 SmallVector<Elt, 8> Expression;
518
519 Predicate(SmallVectorImpl<Elt> &&Expr) { Expression.swap(Expr); };
520
521public:
522 Predicate(std::function<bool(const MachineInstr &)> Pred) {
523 Expression.push_back({Pred, false, 1, 1});
524 };
525
526 bool operator()(const MachineInstr &MI) const {
527 unsigned Idx = 0;
528 unsigned ResultIdx = Expression.size();
529 bool Result;
530 do {
531 Result = Expression[Idx].Pred(MI);
532 Result = Expression[Idx].Neg ? !Result : Result;
533 if (Result) {
534 Idx += Expression[Idx].TJumpOffset;
535 } else {
536 Idx += Expression[Idx].FJumpOffset;
537 }
538 } while ((Idx != ResultIdx));
539
540 return Result;
541 };
542
543 Predicate operator!() const {
544 SmallVector<Elt, 8> NegExpression;
545 for (const Elt &ExprElt : Expression) {
546 NegExpression.push_back({ExprElt.Pred, !ExprElt.Neg, ExprElt.FJumpOffset,
547 ExprElt.TJumpOffset});
548 }
549 return Predicate(std::move(NegExpression));
550 };
551
552 Predicate operator&&(const Predicate &RHS) const {
553 SmallVector<Elt, 8> AndExpression = Expression;
554
555 unsigned RHSSize = RHS.Expression.size();
556 unsigned ResultIdx = Expression.size();
557 for (unsigned i = 0; i < ResultIdx; ++i) {
558 // LHS results in false, whole expression results in false.
559 if (i + AndExpression[i].FJumpOffset == ResultIdx)
560 AndExpression[i].FJumpOffset += RHSSize;
561 }
562
563 AndExpression.append(RHS.Expression);
564
565 return Predicate(std::move(AndExpression));
566 }
567
568 Predicate operator||(const Predicate &RHS) const {
569 SmallVector<Elt, 8> OrExpression = Expression;
570
571 unsigned RHSSize = RHS.Expression.size();
572 unsigned ResultIdx = Expression.size();
573 for (unsigned i = 0; i < ResultIdx; ++i) {
574 // LHS results in true, whole expression results in true.
575 if (i + OrExpression[i].TJumpOffset == ResultIdx)
576 OrExpression[i].TJumpOffset += RHSSize;
577 }
578
579 OrExpression.append(RHS.Expression);
580
581 return Predicate(std::move(OrExpression));
582 }
583};
584
585// Initialize rules
588 : ST(&_ST), MRI(&_MRI) {
589
590 addRulesForGOpcs({G_ADD, G_SUB}, Standard)
591 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32AExt, Sgpr32AExt}})
592 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
593 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
594 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
596 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
597 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr64}})
598 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
601
602 addRulesForGOpcs({G_UADDO, G_USUBO}, Standard)
603 .Uni(S32, {{Sgpr32, Sgpr32Trunc}, {Sgpr32, Sgpr32}})
604 .Div(S32, {{Vgpr32, Vcc}, {Vgpr32, Vgpr32}});
605
606 addRulesForGOpcs({G_UADDE, G_USUBE, G_SADDE, G_SSUBE}, Standard)
608 .Div(S32, {{Vgpr32, Vcc}, {Vgpr32, Vgpr32, Vcc}});
609
610 addRulesForGOpcs({G_UADDSAT, G_SADDSAT, G_USUBSAT, G_SSUBSAT}, Standard)
611 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}})
612 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
613 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}})
614 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
616 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}});
617
618 bool UseVecMulU64 = ST->useVMulU64Inst();
619 addRulesForGOpcs({G_MUL}, Standard)
620 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
621 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
622 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
623 .Uni(S64, {{SgprB64}, {SgprB64, SgprB64}})
625 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
626 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32AExt, Sgpr32AExt}})
627 .Div(S64, {{VgprB64}, {VgprB64, VgprB64}}, UseVecMulU64)
628 .Div(S64, {{VgprB64}, {VgprB64, VgprB64}, SplitTo32Mul}, !UseVecMulU64);
629
630 bool hasMulHi = ST->hasScalarMulHiInsts();
631 addRulesForGOpcs({G_UMULH, G_SMULH}, Standard)
632 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
633 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasMulHi)
634 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasMulHi);
635
636 addRulesForGOpcs({G_AMDGPU_MAD_U64_U32}, Standard)
637 .Div(S64, {{Vgpr64, Vcc}, {Vgpr32, Vgpr32, Vgpr64}})
639
640 bool HasScalarSMulU64 = ST->hasScalarSMulU64();
641 addRulesForGOpcs({G_AMDGPU_S_MUL_U64_U32, G_AMDGPU_S_MUL_I64_I32}, Standard)
642 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr64}, UniMul64}, HasScalarSMulU64)
643 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}, DivSMulToMAD});
644
645 addRulesForGOpcs({G_XOR, G_OR, G_AND}, StandardB)
647 .Any({{DivS1}, {{Vcc}, {Vcc, Vcc}}})
648 .Any({{UniS16}, {{Sgpr16}, {Sgpr16, Sgpr16}}})
649 .Any({{DivS16}, {{Vgpr16}, {Vgpr16, Vgpr16}}})
650 .Uni(B32, {{SgprB32}, {SgprB32, SgprB32}})
651 .Div(B32, {{VgprB32}, {VgprB32, VgprB32}})
652 .Uni(B64, {{SgprB64}, {SgprB64, SgprB64}})
653 .Div(B64, {{VgprB64}, {VgprB64, VgprB64}, SplitTo32});
654
655 addRulesForGOpcs({G_SHL}, Standard)
656 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32AExt, Sgpr32ZExt}})
657 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
659 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
660 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
661 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32}})
662 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
663 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
664
665 addRulesForGOpcs({G_LSHR}, Standard)
666 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32ZExt, Sgpr32ZExt}})
667 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
669 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
670 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
671 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32}})
672 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
673 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
674
675 addRulesForGOpcs({G_ASHR}, Standard)
676 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32SExt, Sgpr32ZExt}})
677 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
679 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
680 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
681 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32}})
682 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
683 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
684
685 addRulesForGOpcs({G_FSHR}, Standard)
686 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
687 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
688
689 addRulesForGOpcs({G_BSWAP}, Standard)
690 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
691 .Div(S16, {{Vgpr16}, {Vgpr16}})
692 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
693 .Div(S32, {{Vgpr32}, {Vgpr32}})
694 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16}})
695 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}});
696
697 addRulesForGOpcs({G_AMDGPU_CVT_F32_UBYTE0, G_AMDGPU_CVT_F32_UBYTE1,
698 G_AMDGPU_CVT_F32_UBYTE2, G_AMDGPU_CVT_F32_UBYTE3,
699 G_AMDGPU_RCP_IFLAG},
700 Standard)
701 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
702 .Div(S32, {{Vgpr32}, {Vgpr32}});
703
704 addRulesForGOpcs({G_FRAME_INDEX}).Any({{UniP5, _}, {{SgprP5}, {None}}});
705
706 addRulesForGOpcs({G_UBFX, G_SBFX}, Standard)
707 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32, Sgpr32}, S_BFE})
708 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}})
709 .Uni(S64, {{Sgpr64}, {Sgpr64, Sgpr32, Sgpr32}, S_BFE})
710 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32, Vgpr32}, V_BFE});
711
712 addRulesForGOpcs({G_SMIN, G_SMAX}, Standard)
713 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32SExt, Sgpr32SExt}})
714 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
715 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
716 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
718 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
719 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
720 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}});
721
722 addRulesForGOpcs({G_UMIN, G_UMAX}, Standard)
723 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32ZExt, Sgpr32ZExt}})
724 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
725 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}})
726 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
728 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
729 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
730 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}});
731
732 addRulesForGOpcs({G_IMPLICIT_DEF})
733 .Any({{UniS1}, {{Sgpr32Trunc}, {}}})
734 .Any({{UniS16}, {{Sgpr16}, {}}})
735 .Any({{UniBRC}, {{SgprBRC}, {}}});
736
737 addRulesForGOpcs({G_CONSTANT}, Standard)
738 .Any({{UniS1, _}, {{Sgpr32Trunc}, {}, UniCstExt}})
739 .Uni(S16, {{Sgpr16}, {}})
740 .Uni(S32, {{Sgpr32}, {}})
741 .Uni(S64, {{Sgpr64}, {}})
742 .Any({{UniPtr32, _}, {{SgprPtr32}, {}}})
743 .Any({{UniPtr64, _}, {{SgprPtr64}, {}}});
744
745 addRulesForGOpcs({G_FCONSTANT}, Standard)
746 .Uni(S16, {{Sgpr16}, {}})
747 .Uni(S32, {{Sgpr32}, {}})
748 .Uni(S64, {{Sgpr64}, {}});
749
750 addRulesForGOpcs({G_FREEZE})
751 .Any({{UniS1}, {{Sgpr32Trunc}, {Sgpr32AExt}}})
752 .Any({{DivS1}, {{Vcc}, {Vcc}}})
753 .Any({{UniS16}, {{Sgpr16}, {Sgpr16}}})
754 .Any({{UniBRC}, {{SgprBRC}, {SgprBRC}}})
755 .Any({{DivBRC}, {{VgprBRC}, {VgprBRC}}});
756
757 addRulesForGOpcs({G_BITCAST})
758 .Any({{UniS16}, {{Sgpr16}, {Sgpr16}}})
759 .Any({{DivS16}, {{Vgpr16}, {Vgpr16}}})
760 .Any({{UniBRC}, {{SgprBRC}, {SgprBRC}}})
761 .Any({{DivBRC}, {{VgprBRC}, {VgprBRC}}});
762
763 addRulesForGOpcs({G_UNMERGE_VALUES})
764 .Any({{UniS16}, {{}, {}, UnmergeToShiftTrunc}})
765 .Any({{UniBRC}, {{}, {}, VerifyAllSgpr}})
766 .Any({{DivBRC}, {{}, {}, ApplyAllVgpr}});
767
768 addRulesForGOpcs({G_BUILD_VECTOR, G_MERGE_VALUES})
769 .Any({{UniBRC, S16}, {{}, {}, VerifyAllSgpr}})
770 .Any({{UniBRC, BRC}, {{}, {}, VerifyAllSgpr}})
771 .Any({{DivBRC, S16}, {{}, {}, ApplyAllVgpr}})
772 .Any({{DivBRC, BRC}, {{}, {}, ApplyAllVgpr}});
773
774 addRulesForGOpcs({G_CONCAT_VECTORS})
775 .Any({{UniBRC, BRC}, {{}, {}, VerifyAllSgpr}})
776 .Any({{DivBRC, BRC}, {{}, {}, ApplyAllVgpr}});
777
778 addRulesForGOpcs({G_PHI})
779 .Any({{UniS1}, {{}, {}, AextToS32InIncomingBlockGPHI}})
780 .Any({{UniS16}, {{}, {}, VerifyAllSgprGPHI}})
781 .Any({{UniBRC}, {{}, {}, VerifyAllSgprGPHI}})
782 .Any({{DivBRC}, {{}, {}, VerifyAllSgprOrVgprGPHI}});
783
784 addRulesForGOpcs({G_EXTRACT_VECTOR_ELT})
785 .Any({{UniB32, UniBRC, UniS32}, {{SgprB32}, {SgprBRC, Sgpr32}}})
786 .Any({{DivB32, DivBRC, UniS32}, {{VgprB32}, {VgprBRC, Sgpr32}}})
787 .Any({{DivB32, BRC, DivS32},
789 .Any({{UniB64, UniBRC, UniS32}, {{SgprB64}, {SgprBRC, Sgpr32}}})
790 .Any({{DivB64, DivBRC, UniS32},
792 .Any({{DivB64, BRC, DivS32},
794
795 addRulesForGOpcs({G_INSERT_VECTOR_ELT})
797 {{SgprBRC}, {SgprBRC, SgprB32, Sgpr32}}})
798 .Any(
799 {{DivBRC, BRC, B32, UniS32}, {{VgprBRC}, {VgprBRC, VgprB32, Sgpr32}}})
800 .Any({{DivBRC, BRC, B32, DivS32},
804 .Any({{DivBRC, BRC, B64, UniS32},
806 .Any({{DivBRC, BRC, B64, DivS32},
808
809 // INTERSECT_RAY {Div}, {{VgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
810 // INTERSECT_RAY {Uni}, {{UniInVgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
811 addRulesForGOpcs({G_AMDGPU_BVH_INTERSECT_RAY, G_AMDGPU_BVH_DUAL_INTERSECT_RAY,
812 G_AMDGPU_BVH8_INTERSECT_RAY})
813 .Any({{}, {{}, {}, ApplyBVH_INTERSECT_RAY}});
814
815 // LOAD {Div}, {{VgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
816 // LOAD {Uni}, {{UniInVgprDst...}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
817 // LOAD_NORET {}, {{}, {Imm, VgprSrc, ..., Sgpr_WF_RsrcIdx}}
818 // STORE {}, {{}, {VgprSrc, ..., Sgpr_WF_RsrcIdx}}
819 addRulesForGOpcs({G_AMDGPU_INTRIN_IMAGE_LOAD, G_AMDGPU_INTRIN_IMAGE_LOAD_D16,
820 G_AMDGPU_INTRIN_IMAGE_LOAD_NORET,
821 G_AMDGPU_INTRIN_IMAGE_STORE,
822 G_AMDGPU_INTRIN_IMAGE_STORE_D16})
823 .Any({{}, {{}, {}, ApplyINTRIN_IMAGE}});
824
825 Predicate isSignedICmp([](const MachineInstr &MI) -> bool {
826 auto Pred =
827 static_cast<CmpInst::Predicate>(MI.getOperand(1).getPredicate());
828 return CmpInst::isSigned(Pred);
829 });
830
831 Predicate isEqualityICmp([](const MachineInstr &MI) -> bool {
832 auto Pred =
833 static_cast<CmpInst::Predicate>(MI.getOperand(1).getPredicate());
834 return ICmpInst::isEquality(Pred);
835 });
836
837 bool HasScalarCompareEq64 = ST->hasScalarCompareEq64();
838 // clang-format off
839 addRulesForGOpcs({G_ICMP})
840 .Any({{{UniS1, _, S16}, isEqualityICmp}, {{Sgpr32Trunc}, {None, Sgpr32ZExt, Sgpr32ZExt}}})
841 .Any({{{UniS1, _, S16}, !isEqualityICmp && isSignedICmp}, {{Sgpr32Trunc}, {None, Sgpr32SExt, Sgpr32SExt}}})
842 .Any({{{UniS1, _, S16}, !isEqualityICmp && !isSignedICmp}, {{Sgpr32Trunc}, {None, Sgpr32ZExt, Sgpr32ZExt}}})
843 .Any({{{DivS1, _, S16}}, {{Vcc}, {None, Vgpr16, Vgpr16}}})
844 .Any({{{UniS1, _, S32}}, {{Sgpr32Trunc}, {None, Sgpr32, Sgpr32}}})
845 .Any({{{DivS1, _, S32}}, {{Vcc}, {None, Vgpr32, Vgpr32}}})
846 .Any({{{UniS1, _, S64}, isEqualityICmp}, {{Sgpr32Trunc}, {None, Sgpr64, Sgpr64}}}, HasScalarCompareEq64)
847 .Any({{{UniS1, _, S64}, isEqualityICmp}, {{UniInVcc}, {None, Vgpr64, Vgpr64}}}, !HasScalarCompareEq64)
848 .Any({{{UniS1, _, S64}, !isEqualityICmp}, {{UniInVcc}, {None, Vgpr64, Vgpr64}}})
849 .Any({{{DivS1, _, S64}}, {{Vcc}, {None, Vgpr64, Vgpr64}}})
850 .Any({{{UniS1, _, Ptr32}}, {{Sgpr32Trunc}, {None, SgprPtr32, SgprPtr32}}})
851 .Any({{{DivS1, _, Ptr32}}, {{Vcc}, {None, VgprPtr32, VgprPtr32}}})
852 .Any({{{UniS1, _, Ptr64}, isEqualityICmp}, {{Sgpr32Trunc}, {None, SgprPtr64, SgprPtr64}}}, HasScalarCompareEq64)
853 .Any({{{UniS1, _, Ptr64}, isEqualityICmp}, {{UniInVcc}, {None, VgprPtr64, VgprPtr64}}}, !HasScalarCompareEq64)
854 .Any({{{UniS1, _, Ptr64}, !isEqualityICmp}, {{UniInVcc}, {None, VgprPtr64, VgprPtr64}}})
855 .Any({{{DivS1, _, Ptr64}}, {{Vcc}, {None, VgprPtr64, VgprPtr64}}});
856 // clang-format on
857
858 addRulesForGOpcs({G_BRCOND})
859 .Any({{UniS1}, {{}, {Sgpr32AExtBoolInReg}}})
860 .Any({{DivS1}, {{}, {Vcc}}});
861
862 addRulesForGOpcs({G_BR}).Any({{_}, {{}, {None}}});
863
864 addRulesForGOpcs({G_SELECT}, StandardB)
865 .Any({{DivS16}, {{Vgpr16}, {Vcc, Vgpr16, Vgpr16}}})
867 .Div(B32, {{VgprB32}, {Vcc, VgprB32, VgprB32}})
871
872 addRulesForGOpcs({G_ANYEXT})
873 .Any({{UniS16, S1}, {{None}, {None}}}) // should be combined away
874 .Any({{UniS32, S1}, {{None}, {None}}}) // should be combined away
875 .Any({{UniS64, S1}, {{None}, {None}}}) // should be combined away
876 .Any({{DivS16, S1}, {{Vgpr16}, {Vcc}, VccExtToSel}})
877 .Any({{DivS32, S1}, {{Vgpr32}, {Vcc}, VccExtToSel}})
878 .Any({{DivS64, S1}, {{Vgpr64}, {Vcc}, VccExtToSel}})
879 .Any({{UniS64, S32}, {{Sgpr64}, {Sgpr32}, Ext32To64}})
880 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}, Ext32To64}})
881 .Any({{UniS64, S16}, {{Sgpr64}, {Sgpr32AExt}, Ext32To64}})
882 .Any({{DivS64, S16}, {{Vgpr64}, {Vgpr32AExt}, Ext32To64}})
883 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}})
884 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}});
885
886 bool Has16bitCmp = ST->has16BitInsts();
887
888 // In global-isel G_TRUNC in-reg is treated as no-op, inst selected into COPY.
889 // It is up to user to deal with truncated bits.
890 // S1, S16, S32 and S64 results are handled with specific rules. Remaining
891 // (result, source) pairs with valid register classes are covered by the
892 // generic UniBRC/DivBRC wildcard rules.
893 addRulesForGOpcs({G_TRUNC})
894 .Any({{UniS1, UniS16}, {{None}, {None}}}) // should be combined away
895 .Any({{UniS1, UniS32}, {{None}, {None}}}) // should be combined away
896 .Any({{UniS1, UniS64}, {{None}, {None}}}) // should be combined away
897 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}})
898 .Any({{UniBRC, UniBRC}, {{SgprBRC}, {SgprBRC}}})
899 .Any({{DivBRC, DivBRC}, {{VgprBRC}, {VgprBRC}}})
900 .Any({{UniV2S16, V2S32}, {{SgprV2S16}, {SgprV2S32}}})
901 .Any({{DivV2S16, V2S32}, {{VgprV2S16}, {VgprV2S32}}})
902 // This is non-trivial. VgprToVccCopy is done using compare instruction.
903 .Any({{DivS1, DivS16}, {{Vcc}, {Vgpr16}, VgprToVccCopy}}, Has16bitCmp)
905 !Has16bitCmp)
906 .Any({{DivS1, DivS32}, {{Vcc}, {Vgpr32}, VgprToVccCopy}})
907 .Any({{DivS1, DivS64}, {{Vcc}, {Vgpr64}, VgprToVccCopy}});
908
909 addRulesForGOpcs({G_ZEXT})
913 .Any({{DivS16, S1}, {{Vgpr16}, {Vcc}, VccExtToSel}})
914 .Any({{DivS32, S1}, {{Vgpr32}, {Vcc}, VccExtToSel}})
915 .Any({{DivS64, S1}, {{Vgpr64}, {Vcc}, VccExtToSel}})
916 .Any({{UniS64, S32}, {{Sgpr64}, {Sgpr32}, Ext32To64}})
917 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}, Ext32To64}})
918 // not extending S16 to S32 is questionable.
919 .Any({{UniS64, S16}, {{Sgpr64}, {Sgpr32ZExt}, Ext32To64}})
920 .Any({{DivS64, S16}, {{Vgpr64}, {Vgpr32ZExt}, Ext32To64}})
921 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}})
922 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}});
923
924 addRulesForGOpcs({G_SEXT})
928 .Any({{DivS16, S1}, {{Vgpr16}, {Vcc}, VccExtToSel}})
929 .Any({{DivS32, S1}, {{Vgpr32}, {Vcc}, VccExtToSel}})
930 .Any({{DivS64, S1}, {{Vgpr64}, {Vcc}, VccExtToSel}})
931 .Any({{UniS64, S32}, {{Sgpr64}, {Sgpr32}, Ext32To64}})
932 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}, Ext32To64}})
933 // not extending S16 to S32 is questionable.
934 .Any({{UniS64, S16}, {{Sgpr64}, {Sgpr32SExt}, Ext32To64}})
935 .Any({{DivS64, S16}, {{Vgpr64}, {Vgpr32SExt}, Ext32To64}})
936 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}})
937 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}});
938
939 addRulesForGOpcs({G_SEXT_INREG})
940 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}})
941 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
942 .Any({{UniS64, S64}, {{Sgpr64}, {Sgpr64}}})
944
945 addRulesForGOpcs({G_ASSERT_ZEXT, G_ASSERT_SEXT}, Standard)
946 .Uni(S32, {{Sgpr32}, {Sgpr32, Imm}})
947 .Div(S32, {{Vgpr32}, {Vgpr32, Imm}})
948 .Uni(S64, {{Sgpr64}, {Sgpr64, Imm}})
949 .Div(S64, {{Vgpr64}, {Vgpr64, Imm}});
950
951 addRulesForGOpcs({G_ASSERT_ALIGN}, Standard)
952 .Uni(S32, {{Sgpr32}, {Sgpr32}})
953 .Div(S32, {{Vgpr32}, {Vgpr32}})
954 .Uni(S64, {{Sgpr64}, {Sgpr64}})
955 .Div(S64, {{Vgpr64}, {Vgpr64}})
956 .Any({{UniPtr32}, {{SgprPtr32}, {SgprPtr32}}})
957 .Any({{DivPtr32}, {{VgprPtr32}, {VgprPtr32}}})
958 .Any({{UniPtr64}, {{SgprPtr64}, {SgprPtr64}}})
959 .Any({{DivPtr64}, {{VgprPtr64}, {VgprPtr64}}});
960
961 // Atomic read-modify-write operations: result and value are always VGPR,
962 // pointer varies by address space.
963 addRulesForGOpcs({G_ATOMICRMW_ADD, G_ATOMICRMW_SUB, G_ATOMICRMW_XCHG,
964 G_ATOMICRMW_AND, G_ATOMICRMW_OR, G_ATOMICRMW_XOR,
965 G_ATOMICRMW_MIN, G_ATOMICRMW_MAX, G_ATOMICRMW_UMIN,
966 G_ATOMICRMW_UMAX, G_ATOMICRMW_UINC_WRAP,
967 G_ATOMICRMW_UDEC_WRAP, G_ATOMICRMW_FMIN, G_ATOMICRMW_FMAX})
968 .Any({{DivS32, P0, S32}, {{Vgpr32}, {VgprP0, Vgpr32}}})
969 .Any({{DivS64, P0, S64}, {{Vgpr64}, {VgprP0, Vgpr64}}})
970 .Any({{DivS32, P1, S32}, {{Vgpr32}, {VgprP1, Vgpr32}}})
971 .Any({{DivS64, P1, S64}, {{Vgpr64}, {VgprP1, Vgpr64}}})
972 .Any({{DivS32, P3, S32}, {{Vgpr32}, {VgprP3, Vgpr32}}})
973 .Any({{DivS64, P3, S64}, {{Vgpr64}, {VgprP3, Vgpr64}}});
974
975 addRulesForGOpcs({G_ATOMICRMW_USUB_SAT, G_ATOMICRMW_USUB_COND})
976 .Any({{DivS32, P0}, {{Vgpr32}, {VgprP0, Vgpr32}}})
977 .Any({{DivS32, P1}, {{Vgpr32}, {VgprP1, Vgpr32}}})
978 .Any({{DivS32, P3}, {{Vgpr32}, {VgprP3, Vgpr32}}});
979
980 bool HasAtomicFlatPkAdd16Insts = ST->hasAtomicFlatPkAdd16Insts();
981 bool HasAtomicBufferGlobalPkAddF16Insts =
982 ST->hasAtomicBufferGlobalPkAddF16NoRtnInsts() ||
983 ST->hasAtomicBufferGlobalPkAddF16Insts();
984 bool HasAtomicDsPkAdd16Insts = ST->hasAtomicDsPkAdd16Insts();
985 addRulesForGOpcs({G_ATOMICRMW_FADD})
986 .Any({{DivS32, P0, S32}, {{Vgpr32}, {VgprP0, Vgpr32}}})
987 .Any({{DivS64, P0, S64}, {{Vgpr64}, {VgprP0, Vgpr64}}})
988 .Any({{DivS32, P1, S32}, {{Vgpr32}, {VgprP1, Vgpr32}}})
989 .Any({{DivS64, P1, S64}, {{Vgpr64}, {VgprP1, Vgpr64}}})
990 .Any({{DivS32, P3, S32}, {{Vgpr32}, {VgprP3, Vgpr32}}})
991 .Any({{DivS64, P3, S64}, {{Vgpr64}, {VgprP3, Vgpr64}}})
992 .Any({{DivV2S16, P0, V2S16}, {{VgprV2S16}, {VgprP0, VgprV2S16}}},
993 HasAtomicFlatPkAdd16Insts)
994 .Any({{DivV2S16, P1, V2S16}, {{VgprV2S16}, {VgprP1, VgprV2S16}}},
995 HasAtomicBufferGlobalPkAddF16Insts)
996 .Any({{DivV2S16, P3, V2S16}, {{VgprV2S16}, {VgprP3, VgprV2S16}}},
997 HasAtomicDsPkAdd16Insts);
998
999 addRulesForGOpcs({G_ATOMIC_CMPXCHG})
1000 .Any({{DivS32, P2}, {{Vgpr32}, {VgprP2, Vgpr32, Vgpr32}}})
1001 .Any({{DivS64, P2}, {{Vgpr64}, {VgprP2, Vgpr64, Vgpr64}}})
1002 .Any({{DivS32, P3}, {{Vgpr32}, {VgprP3, Vgpr32, Vgpr32}}})
1003 .Any({{DivS64, P3}, {{Vgpr64}, {VgprP3, Vgpr64, Vgpr64}}});
1004
1005 addRulesForGOpcs({G_AMDGPU_ATOMIC_CMPXCHG})
1006 .Any({{DivS32, P0}, {{Vgpr32}, {VgprP0, VgprV2S32}}})
1007 .Any({{DivS32, P1}, {{Vgpr32}, {VgprP1, VgprV2S32}}})
1008 .Any({{DivS64, P0}, {{Vgpr64}, {VgprP0, VgprV2S64}}})
1009 .Any({{DivS64, P1}, {{Vgpr64}, {VgprP1, VgprV2S64}}});
1010
1011 addRulesForGOpcs({G_AMDGPU_BUFFER_ATOMIC_CMPSWAP}, Standard)
1012 .Div(S32, {{Vgpr32},
1014 .Div(S64, {{Vgpr64},
1016
1017 addRulesForGOpcs({G_AMDGPU_BUFFER_ATOMIC_ADD, G_AMDGPU_BUFFER_ATOMIC_AND,
1018 G_AMDGPU_BUFFER_ATOMIC_DEC, G_AMDGPU_BUFFER_ATOMIC_FMAX,
1019 G_AMDGPU_BUFFER_ATOMIC_FMIN, G_AMDGPU_BUFFER_ATOMIC_INC,
1020 G_AMDGPU_BUFFER_ATOMIC_OR, G_AMDGPU_BUFFER_ATOMIC_SMAX,
1021 G_AMDGPU_BUFFER_ATOMIC_SMIN, G_AMDGPU_BUFFER_ATOMIC_SUB,
1022 G_AMDGPU_BUFFER_ATOMIC_SWAP, G_AMDGPU_BUFFER_ATOMIC_UMAX,
1023 G_AMDGPU_BUFFER_ATOMIC_UMIN, G_AMDGPU_BUFFER_ATOMIC_XOR},
1024 Standard)
1027
1028 bool hasSMRDx3 = ST->hasScalarDwordx3Loads();
1029 bool hasSMRDSmall = ST->hasScalarSubwordLoads();
1030 bool usesTrue16 = ST->useRealTrue16Insts();
1031
1032 Predicate isAlign16([](const MachineInstr &MI) -> bool {
1033 return (*MI.memoperands_begin())->getAlign() >= Align(16);
1034 });
1035
1036 Predicate isAlign4([](const MachineInstr &MI) -> bool {
1037 return (*MI.memoperands_begin())->getAlign() >= Align(4);
1038 });
1039
1040 Predicate isAtomicMMO([](const MachineInstr &MI) -> bool {
1041 return (*MI.memoperands_begin())->isAtomic();
1042 });
1043
1044 Predicate isUniMMO([](const MachineInstr &MI) -> bool {
1045 return AMDGPU::isUniformMMO(*MI.memoperands_begin());
1046 });
1047
1048 Predicate isConst([](const MachineInstr &MI) -> bool {
1049 // Address space in MMO be different then address space on pointer.
1050 const MachineMemOperand *MMO = *MI.memoperands_begin();
1051 const unsigned AS = MMO->getAddrSpace();
1052 return AS == AMDGPUAS::CONSTANT_ADDRESS ||
1054 });
1055
1056 Predicate isVolatileMMO([](const MachineInstr &MI) -> bool {
1057 return (*MI.memoperands_begin())->isVolatile();
1058 });
1059
1060 Predicate isInvMMO([](const MachineInstr &MI) -> bool {
1061 return (*MI.memoperands_begin())->isInvariant();
1062 });
1063
1064 Predicate isNoClobberMMO([](const MachineInstr &MI) -> bool {
1065 return (*MI.memoperands_begin())->getFlags() & MONoClobber;
1066 });
1067
1068 Predicate isNaturalAligned([](const MachineInstr &MI) -> bool {
1069 const MachineMemOperand *MMO = *MI.memoperands_begin();
1070 return MMO->getAlign() >= Align(MMO->getSize().getValue());
1071 });
1072
1073 Predicate is8Or16BitMMO([](const MachineInstr &MI) -> bool {
1074 const MachineMemOperand *MMO = *MI.memoperands_begin();
1075 const unsigned MemSize = 8 * MMO->getSize().getValue();
1076 return MemSize == 16 || MemSize == 8;
1077 });
1078
1079 Predicate is32BitMMO([](const MachineInstr &MI) -> bool {
1080 const MachineMemOperand *MMO = *MI.memoperands_begin();
1081 return 8 * MMO->getSize().getValue() == 32;
1082 });
1083
1084 auto isUL = !isAtomicMMO && isUniMMO && (isConst || !isVolatileMMO) &&
1085 (isConst || isInvMMO || isNoClobberMMO);
1086
1087 // clang-format off
1088 // TODO: S32Dst, 16-bit any-extending load should not appear on True16 targets
1089 addRulesForGOpcs({G_LOAD})
1090 // flat, addrspace(0), never uniform - flat_load
1091 .Any({{DivS16, P0}, {{Vgpr16}, {VgprP0}}}, usesTrue16)
1092 .Any({{DivB32, P0}, {{VgprB32}, {VgprP0}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1093 .Any({{DivB64, P0}, {{VgprB64}, {VgprP0}}})
1094 .Any({{DivB96, P0}, {{VgprB96}, {VgprP0}}})
1095 .Any({{DivB128, P0}, {{VgprB128}, {VgprP0}}})
1096
1097 // global, addrspace(1)
1098 // divergent - global_load
1099 .Any({{DivS16, P1}, {{Vgpr16}, {VgprP1}}}, usesTrue16)
1100 .Any({{DivB32, P1}, {{VgprB32}, {VgprP1}}}) //32-bit load, 8-bit and 16-bit any-extending load
1101 .Any({{DivB64, P1}, {{VgprB64}, {VgprP1}}})
1102 .Any({{DivB96, P1}, {{VgprB96}, {VgprP1}}})
1103 .Any({{DivB128, P1}, {{VgprB128}, {VgprP1}}})
1104 .Any({{DivB256, P1}, {{VgprB256}, {VgprP1}, SplitLoad}})
1105 .Any({{DivB512, P1}, {{VgprB512}, {VgprP1}, SplitLoad}})
1106
1107 // uniform - s_load
1108 .Any({{{UniS16, P1}, isNaturalAligned && isUL}, {{Sgpr32Trunc}, {SgprP1}}}, usesTrue16 && hasSMRDSmall) // s16 load
1109 .Any({{{UniS16, P1}, isAlign4 && isUL}, {{Sgpr32Trunc}, {SgprP1}, WidenMMOToS32}}, usesTrue16 && !hasSMRDSmall) // s16 load to 32-bit load
1110 .Any({{{UniB32, P1}, isNaturalAligned && isUL}, {{SgprB32}, {SgprP1}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1111 // TODO: SplitLoad when !isNaturalAligned && isUL and target hasSMRDSmall
1112 .Any({{{UniB32, P1}, is8Or16BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP1}, WidenMMOToS32}}, !hasSMRDSmall) //8-bit and 16-bit any-extending load to 32-bit load
1113 .Any({{{UniB32, P1}, is32BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP1}}}) //32-bit load
1114 .Any({{{UniB64, P1}, isAlign4 && isUL}, {{SgprB64}, {SgprP1}}})
1115 .Any({{{UniB96, P1}, isAlign16 && isUL}, {{SgprB96}, {SgprP1}, WidenLoad}}, !hasSMRDx3)
1116 .Any({{{UniB96, P1}, isAlign4 && !isAlign16 && isUL}, {{SgprB96}, {SgprP1}, SplitLoad}}, !hasSMRDx3)
1117 .Any({{{UniB96, P1}, isAlign4 && isUL}, {{SgprB96}, {SgprP1}}}, hasSMRDx3)
1118 .Any({{{UniB128, P1}, isAlign4 && isUL}, {{SgprB128}, {SgprP1}}})
1119 .Any({{{UniB256, P1}, isAlign4 && isUL}, {{SgprB256}, {SgprP1}}})
1120 .Any({{{UniB512, P1}, isAlign4 && isUL}, {{SgprB512}, {SgprP1}}})
1121
1122 // Uniform via global or buffer load, for example volatile or non-aligned
1123 // uniform load. Not using standard {{UniInVgprTy}, {VgprP1}} since it is
1124 // selected as global_load, use SgprP1 for pointer instead to match
1125 // patterns without flat-for-global, default for GFX7 and older.
1126 // -> +flat-for-global + {{UniInVgprTy}, {SgprP1}} - global_load
1127 // -> -flat-for-global + {{UniInVgprTy}, {SgprP1}} - buffer_load
1128 .Any({{{UniS16, P1}, !isNaturalAligned || !isUL}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && hasSMRDSmall) // s16 load
1129 .Any({{{UniS16, P1}, !isAlign4 || !isUL}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && !hasSMRDSmall) // s16 load
1130 .Any({{{UniB32, P1}, !isNaturalAligned || !isUL}, {{UniInVgprB32}, {SgprP1}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1131 .Any({{{UniB32, P1}, !isAlign4 || !isUL}, {{UniInVgprB32}, {SgprP1}}}, !hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1132 .Any({{{UniB64, P1}, !isAlign4 || !isUL}, {{UniInVgprB64}, {SgprP1}}})
1133 .Any({{{UniB96, P1}, !isAlign4 || !isUL}, {{UniInVgprB96}, {SgprP1}}})
1134 .Any({{{UniB128, P1}, !isAlign4 || !isUL}, {{UniInVgprB128}, {SgprP1}}})
1135 .Any({{{UniB256, P1}, !isAlign4 || !isUL}, {{UniInVgprB256}, {SgprP1}, SplitLoad}})
1136 .Any({{{UniB512, P1}, !isAlign4 || !isUL}, {{UniInVgprB512}, {SgprP1}, SplitLoad}})
1137
1138 // local, addrspace(3) - ds_load
1139 .Any({{DivS16, P3}, {{Vgpr16}, {VgprP3}}}, usesTrue16)
1140 .Any({{DivB32, P3}, {{VgprB32}, {VgprP3}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1141 .Any({{DivB64, P3}, {{VgprB64}, {VgprP3}}})
1142 .Any({{DivB96, P3}, {{VgprB96}, {VgprP3}}})
1143 .Any({{DivB128, P3}, {{VgprB128}, {VgprP3}}})
1144
1145 .Any({{UniS16, P3}, {{UniInVgprS16}, {SgprP3}}}, usesTrue16) // 16-bit load
1146 .Any({{UniB32, P3}, {{UniInVgprB32}, {VgprP3}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1147 .Any({{UniB64, P3}, {{UniInVgprB64}, {VgprP3}}})
1148 .Any({{UniB96, P3}, {{UniInVgprB96}, {VgprP3}}})
1149 .Any({{UniB128, P3}, {{UniInVgprB128}, {VgprP3}}})
1150
1151 // constant, addrspace(4)
1152 // divergent - global_load
1153 .Any({{DivS16, P4}, {{Vgpr16}, {VgprP4}}}, usesTrue16)
1154 .Any({{DivB32, P4}, {{VgprB32}, {VgprP4}}}) //32-bit load, 8-bit and 16-bit any-extending load
1155 .Any({{DivB64, P4}, {{VgprB64}, {VgprP4}}})
1156 .Any({{DivB96, P4}, {{VgprB96}, {VgprP4}}})
1157 .Any({{DivB128, P4}, {{VgprB128}, {VgprP4}}})
1158 .Any({{DivB256, P4}, {{VgprB256}, {VgprP4}, SplitLoad}})
1159 .Any({{DivB512, P4}, {{VgprB512}, {VgprP4}, SplitLoad}})
1160
1161 // uniform - s_load
1162 .Any({{{UniS16, P4}, isNaturalAligned && isUL}, {{Sgpr32Trunc}, {SgprP4}}}, usesTrue16 && hasSMRDSmall) // s16 load
1163 .Any({{{UniS16, P4}, isAlign4 && isUL}, {{Sgpr32Trunc}, {SgprP4}, WidenMMOToS32}}, usesTrue16 && !hasSMRDSmall) // s16 load to 32-bit load
1164 .Any({{{UniB32, P4}, isNaturalAligned && isUL}, {{SgprB32}, {SgprP4}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1165 .Any({{{UniB32, P4}, is8Or16BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP4}, WidenMMOToS32}}, !hasSMRDSmall) //8-bit and 16-bit any-extending load to 32-bit load
1166 .Any({{{UniB32, P4}, is32BitMMO && isAlign4 && isUL}, {{SgprB32}, {SgprP4}}}) //32-bit load
1167 .Any({{{UniB64, P4}, isAlign4 && isUL}, {{SgprB64}, {SgprP4}}})
1168 .Any({{{UniB96, P4}, isAlign16 && isUL}, {{SgprB96}, {SgprP4}, WidenLoad}}, !hasSMRDx3)
1169 .Any({{{UniB96, P4}, isAlign4 && !isAlign16 && isUL}, {{SgprB96}, {SgprP4}, SplitLoad}}, !hasSMRDx3)
1170 .Any({{{UniB96, P4}, isAlign4 && isUL}, {{SgprB96}, {SgprP4}}}, hasSMRDx3)
1171 .Any({{{UniB128, P4}, isAlign4 && isUL}, {{SgprB128}, {SgprP4}}})
1172 .Any({{{UniB256, P4}, isAlign4 && isUL}, {{SgprB256}, {SgprP4}}})
1173 .Any({{{UniB512, P4}, isAlign4 && isUL}, {{SgprB512}, {SgprP4}}})
1174
1175 // uniform in vgpr - global_load or buffer_load
1176 .Any({{{UniS16, P4}, !isNaturalAligned || !isUL}, {{UniInVgprS16}, {SgprP4}}}, usesTrue16 && hasSMRDSmall) // s16 load
1177 .Any({{{UniS16, P4}, !isAlign4 || !isUL}, {{UniInVgprS16}, {SgprP4}}}, usesTrue16 && !hasSMRDSmall) // s16 load
1178 .Any({{{UniB32, P4}, !isNaturalAligned || !isUL}, {{UniInVgprB32}, {SgprP4}}}, hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1179 .Any({{{UniB32, P4}, !isAlign4 || !isUL}, {{UniInVgprB32}, {SgprP4}}}, !hasSMRDSmall) //32-bit load, 8-bit and 16-bit any-extending load
1180 .Any({{{UniB64, P4}, !isAlign4 || !isUL}, {{UniInVgprB64}, {SgprP4}}})
1181 .Any({{{UniB96, P4}, !isAlign4 || !isUL}, {{UniInVgprB96}, {SgprP4}}})
1182 .Any({{{UniB128, P4}, !isAlign4 || !isUL}, {{UniInVgprB128}, {SgprP4}}})
1183 .Any({{{UniB256, P4}, !isAlign4 || !isUL}, {{UniInVgprB256}, {SgprP4}, SplitLoad}})
1184 .Any({{{UniB512, P4}, !isAlign4 || !isUL}, {{UniInVgprB512}, {SgprP4}, SplitLoad}})
1185
1186 // private, addrspace(5), never uniform - scratch_load
1187 .Any({{DivS16, P5}, {{Vgpr16}, {VgprP5}}}, usesTrue16)
1188 .Any({{DivB32, P5}, {{VgprB32}, {VgprP5}}}) // 32-bit load, 8-bit and 16-bit any-extending load
1189 .Any({{DivB64, P5}, {{VgprB64}, {VgprP5}}})
1190 .Any({{DivB96, P5}, {{VgprB96}, {VgprP5}}})
1191 .Any({{DivB128, P5}, {{VgprB128}, {VgprP5}}})
1192
1193 .Any({{DivS32, Ptr128}, {{Vgpr32}, {VgprPtr128}}});
1194
1195
1196 addRulesForGOpcs({G_ZEXTLOAD, G_SEXTLOAD}) // i8 and i16 zeroextending loads
1197 .Any({{DivS32, P0}, {{Vgpr32}, {VgprP0}}})
1198 .Any({{DivS16, P0}, {{Vgpr16}, {VgprP0}}}, usesTrue16)
1199
1200 .Any({{DivS32, P1}, {{Vgpr32}, {VgprP1}}})
1201 .Any({{DivS16, P1}, {{Vgpr16}, {VgprP1}}}, usesTrue16)
1202 .Any({{{UniS16, P1}, isUL}, {{Sgpr32Trunc}, {SgprP1}}}, usesTrue16 && hasSMRDSmall)
1203 .Any({{{UniS16, P1}, !isUL}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && hasSMRDSmall)
1204 .Any({{UniS16, P1}, {{UniInVgprS16}, {SgprP1}}}, usesTrue16 && !hasSMRDSmall)
1205 .Any({{{UniS32, P1}, isAlign4 && isUL}, {{Sgpr32}, {SgprP1}, WidenMMOToS32}}, !hasSMRDSmall)
1206 .Any({{{UniS32, P1}, isNaturalAligned && isUL}, {{Sgpr32}, {SgprP1}}}, hasSMRDSmall)
1207 .Any({{{UniS32, P1}, !isAlign4 || !isUL}, {{UniInVgprS32}, {SgprP1}}}, !hasSMRDSmall)
1208 .Any({{{UniS32, P1}, !isNaturalAligned || !isUL}, {{UniInVgprS32}, {SgprP1}}}, hasSMRDSmall)
1209
1210 .Any({{DivS32, P3}, {{Vgpr32}, {VgprP3}}})
1211 .Any({{DivS16, P3}, {{Vgpr16}, {VgprP3}}}, usesTrue16)
1212 .Any({{UniS16, P3}, {{UniInVgprS16}, {SgprP3}}}, usesTrue16)
1213 .Any({{UniS32, P3}, {{UniInVgprS32}, {VgprP3}}})
1214
1215 .Any({{DivS32, P4}, {{Vgpr32}, {VgprP4}}})
1216 .Any({{DivS16, P4}, {{Vgpr16}, {VgprP4}}}, usesTrue16)
1217 .Any({{{UniS16, P4}, isUL}, {{Sgpr32Trunc}, {SgprP4}}}, usesTrue16 && hasSMRDSmall)
1218 .Any({{UniS16, P4}, {{UniInVgprS16}, {SgprP4}}}, usesTrue16 && !hasSMRDSmall)
1219 .Any({{{UniS32, P4}, isAlign4 && isUL}, {{Sgpr32}, {SgprP4}, WidenMMOToS32}}, !hasSMRDSmall)
1220 .Any({{{UniS32, P4}, isNaturalAligned && isUL}, {{Sgpr32}, {SgprP4}}}, hasSMRDSmall)
1221 .Any({{{UniS32, P4}, !isAlign4 || !isUL}, {{UniInVgprS32}, {SgprP4}}}, !hasSMRDSmall)
1222 .Any({{{UniS32, P4}, !isNaturalAligned || !isUL}, {{UniInVgprS32}, {SgprP4}}}, hasSMRDSmall)
1223
1224 .Any({{DivS32, P5}, {{Vgpr32}, {VgprP5}}})
1225 .Any({{DivS16, P5}, {{Vgpr16}, {VgprP5}}}, usesTrue16);
1226
1227 addRulesForGOpcs({G_STORE})
1228 // addrspace(0)
1229 .Any({{S16, P0}, {{}, {Vgpr16, VgprP0}}}, usesTrue16) // 16-bit store
1230 .Any({{B32, P0}, {{}, {VgprB32, VgprP0}}}) // 32-bit store, 8-bit and 16-bit truncating store
1231 .Any({{B64, P0}, {{}, {VgprB64, VgprP0}}})
1232 .Any({{B96, P0}, {{}, {VgprB96, VgprP0}}})
1233 .Any({{B128, P0}, {{}, {VgprB128, VgprP0}}})
1234
1235 // addrspace(1), there are no stores to addrspace(4)
1236 // For targets:
1237 // - with "+flat-for-global" - global_store
1238 // - without(-flat-for-global) - buffer_store addr64
1239 .Any({{S16, DivP1}, {{}, {Vgpr16, VgprP1}}}, usesTrue16) // 16-bit store
1240 .Any({{B32, DivP1}, {{}, {VgprB32, VgprP1}}}) // 32-bit store, 8-bit and 16-bit truncating store
1241 .Any({{B64, DivP1}, {{}, {VgprB64, VgprP1}}})
1242 .Any({{B96, DivP1}, {{}, {VgprB96, VgprP1}}})
1243 .Any({{B128, DivP1}, {{}, {VgprB128, VgprP1}}})
1244
1245 // For UniP1, use sgpr ptr to match flat-for-global patterns. Targets:
1246 // - with "+flat-for-global" - global_store for both sgpr and vgpr ptr
1247 // - without(-flat-for-global) - need sgpr ptr to select buffer_store
1248 .Any({{S16, UniP1}, {{}, {Vgpr16, SgprP1}}}, usesTrue16) // 16-bit store
1249 .Any({{B32, UniP1}, {{}, {VgprB32, SgprP1}}}) // 32-bit store, 8-bit and 16-bit truncating store
1250 .Any({{B64, UniP1}, {{}, {VgprB64, SgprP1}}})
1251 .Any({{B96, UniP1}, {{}, {VgprB96, SgprP1}}})
1252 .Any({{B128, UniP1}, {{}, {VgprB128, SgprP1}}})
1253
1254 // addrspace(3) and addrspace(5)
1255 .Any({{S16, Ptr32}, {{}, {Vgpr16, VgprPtr32}}}, usesTrue16) // 16-bit store
1256 .Any({{B32, Ptr32}, {{}, {VgprB32, VgprPtr32}}}) // 32-bit store, 8-bit and 16-bit truncating store
1257 .Any({{B64, Ptr32}, {{}, {VgprB64, VgprPtr32}}})
1258 .Any({{B96, Ptr32}, {{}, {VgprB96, VgprPtr32}}})
1259 .Any({{B128, Ptr32}, {{}, {VgprB128, VgprPtr32}}});
1260
1261 // clang-format on
1262
1263 addRulesForGOpcs({G_AMDGPU_BUFFER_LOAD, G_AMDGPU_BUFFER_LOAD_FORMAT,
1264 G_AMDGPU_TBUFFER_LOAD_FORMAT},
1265 StandardB)
1274
1275 addRulesForGOpcs({G_AMDGPU_BUFFER_LOAD_USHORT, G_AMDGPU_BUFFER_LOAD_UBYTE,
1276 G_AMDGPU_BUFFER_LOAD_SSHORT, G_AMDGPU_BUFFER_LOAD_SBYTE},
1277 StandardB)
1280
1281 addRulesForGOpcs(
1282 {G_AMDGPU_BUFFER_LOAD_UBYTE_TFE, G_AMDGPU_BUFFER_LOAD_USHORT_TFE},
1283 StandardB)
1286
1287 addRulesForGOpcs({G_AMDGPU_BUFFER_LOAD_TFE, G_AMDGPU_BUFFER_LOAD_FORMAT_TFE},
1288 StandardB)
1296 .Any({{UniB160},
1298
1299 addRulesForGOpcs(
1300 {G_AMDGPU_BUFFER_LOAD_FORMAT_D16, G_AMDGPU_TBUFFER_LOAD_FORMAT_D16},
1301 StandardB)
1308
1309 addRulesForGOpcs({G_AMDGPU_S_BUFFER_LOAD})
1310 // waterfall expansion is part of S_BUF_to_BUF
1311 .Any({{UniB32}, {{SgprB32}, {SgprV4S32, Sgpr32}}})
1312 .Any({{DivB32, UniV4S32, DivB32},
1314 .Any({{DivB32, DivV4S32, UniB32},
1316 .Any({{DivB32, DivV4S32, DivB32},
1318
1319 .Any({{UniB64}, {{SgprB64}, {SgprV4S32, Sgpr32}}})
1320 .Any({{DivB64, UniV4S32, DivB32},
1322 .Any({{DivB64, DivV4S32, UniB32},
1324 .Any({{DivB64, DivV4S32, DivB32},
1326
1327 .Any({{UniB96}, {{SgprB96}, {SgprV4S32, Sgpr32}}})
1328 .Any({{DivB96, UniV4S32, DivB32},
1330 .Any({{DivB96, DivV4S32, UniB32},
1332 .Any({{DivB96, DivV4S32, DivB32},
1334
1335 .Any({{UniB128}, {{SgprB128}, {SgprV4S32, Sgpr32}}})
1336 .Any({{DivB128, UniV4S32, DivB32},
1338 .Any({{DivB128, DivV4S32, UniB32},
1340 .Any({{DivB128, DivV4S32, DivB32},
1342
1343 .Any({{UniB256}, {{SgprB256}, {SgprV4S32, Sgpr32}}})
1344 .Any({{DivB256, UniV4S32, DivB32},
1346 .Any({{DivB256, DivV4S32, UniB32},
1348 .Any({{DivB256, DivV4S32, DivB32},
1350
1351 .Any({{UniB512}, {{SgprB512}, {SgprV4S32, Sgpr32}}})
1352 .Any({{DivB512, UniV4S32, DivB32},
1354 .Any({{DivB512, DivV4S32, UniB32},
1356 .Any({{DivB512, DivV4S32, DivB32},
1358
1359 addRulesForGOpcs({G_AMDGPU_S_BUFFER_LOAD_SBYTE, G_AMDGPU_S_BUFFER_LOAD_UBYTE,
1360 G_AMDGPU_S_BUFFER_LOAD_SSHORT,
1361 G_AMDGPU_S_BUFFER_LOAD_USHORT})
1363 .Any({{DivS32, UniV4S32, DivS32},
1365 .Any({{DivS32, DivV4S32, UniS32},
1367 .Any({{DivS32, DivV4S32, DivS32},
1369
1370 addRulesForGOpcs({G_AMDGPU_BUFFER_STORE, G_AMDGPU_BUFFER_STORE_BYTE,
1371 G_AMDGPU_BUFFER_STORE_SHORT, G_AMDGPU_BUFFER_STORE_FORMAT,
1372 G_AMDGPU_BUFFER_STORE_FORMAT_D16,
1373 G_AMDGPU_TBUFFER_STORE_FORMAT,
1374 G_AMDGPU_TBUFFER_STORE_FORMAT_D16})
1375 .Any({{B32}, {{}, {VgprB32, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}})
1376 .Any({{B64}, {{}, {VgprB64, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}})
1377 .Any({{B96}, {{}, {VgprB96, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}})
1378 .Any({{B128}, {{}, {VgprB128, SgprV4S32_WF, Vgpr32, Vgpr32, Sgpr32_WF}}});
1379
1380 // Buffer atomics: resource descriptor + scalar offset are SGPR, data and
1381 // address components are VGPR.
1382 //
1383 // Operand order (SIInstructions.td BufferAtomicGenericInstruction):
1384 // dst = op vdata, rsrc, vindex, voffset, soffset, offset_imm, cachepolicy,
1385 // idxen_imm
1386 addRulesForGOpcs({G_AMDGPU_BUFFER_ATOMIC_FADD})
1387 .Any({{S32, S32, V4S32, S32, S32, S32},
1389 .Any({{S64, S64, V4S32, S32, S32, S32},
1391 .Any({{V2S16, V2S16, V4S32, S32, S32, S32},
1392 {{VgprV2S16},
1394
1395 addRulesForGOpcs({G_PTR_ADD})
1396 .Any({{UniPtr32}, {{SgprPtr32}, {SgprPtr32, Sgpr32}}})
1397 .Any({{DivPtr32}, {{VgprPtr32}, {VgprPtr32, Vgpr32}}})
1398 .Any({{UniPtr64}, {{SgprPtr64}, {SgprPtr64, Sgpr64}}})
1399 .Any({{DivPtr64}, {{VgprPtr64}, {VgprPtr64, Vgpr64}}});
1400
1401 addRulesForGOpcs({G_INTTOPTR})
1402 .Any({{UniPtr32}, {{SgprPtr32}, {Sgpr32}}})
1403 .Any({{DivPtr32}, {{VgprPtr32}, {Vgpr32}}})
1404 .Any({{UniPtr64}, {{SgprPtr64}, {Sgpr64}}})
1405 .Any({{DivPtr64}, {{VgprPtr64}, {Vgpr64}}})
1406 .Any({{UniPtr128}, {{SgprPtr128}, {Sgpr128}}})
1407 .Any({{DivPtr128}, {{VgprPtr128}, {Vgpr128}}});
1408
1409 addRulesForGOpcs({G_PTRTOINT})
1410 .Any({{UniS32}, {{Sgpr32}, {SgprPtr32}}})
1411 .Any({{DivS32}, {{Vgpr32}, {VgprPtr32}}})
1412 .Any({{UniS64}, {{Sgpr64}, {SgprPtr64}}})
1413 .Any({{DivS64}, {{Vgpr64}, {VgprPtr64}}})
1414 .Any({{UniS128}, {{Sgpr128}, {SgprPtr128}}})
1415 .Any({{DivS128}, {{Vgpr128}, {VgprPtr128}}});
1416
1417 // FIXME: Update llvm/test/CodeGen/AMDGPU/ptrmask.ll to use GlobalISel.
1418 // Currently crashes on P8 (buffer resource) tests due to legalizer issue.
1419 addRulesForGOpcs({G_PTRMASK})
1420 .Any({{UniP1}, {{SgprP1}, {SgprP1, Sgpr64}}})
1421 .Any({{DivP1}, {{VgprP1}, {VgprP1, Vgpr64}}})
1422 .Any({{UniP3}, {{SgprP3}, {SgprP3, Sgpr32}}})
1423 .Any({{DivP3}, {{VgprP3}, {VgprP3, Vgpr32}}});
1424
1425 addRulesForGOpcs({G_DYN_STACKALLOC})
1426 .Any({{UniP5, UniS32}, {{SgprP5}, {Sgpr32}, DynStackAlloc}})
1427 .Any({{UniP5, DivS32}, {{SgprP5}, {Vgpr32}, DynStackAlloc}});
1428
1429 addRulesForGOpcs({G_ABS}, Standard)
1430 .Uni(S16, {{Sgpr32Trunc}, {Sgpr32SExt}})
1431 .Div(S16, {{Vgpr16}, {Vgpr16}, AbsToNegMax})
1432 .Uni(S32, {{Sgpr32}, {Sgpr32}})
1433 .Div(S32, {{Vgpr32}, {Vgpr32}, AbsToNegMax})
1434 .Uni(V2S16, {{SgprV2S16}, {SgprV2S16}, AbsToS32})
1435 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}, AbsToNegMax});
1436
1437 addRulesForGOpcs({G_BITREVERSE}, Standard)
1438 .Uni(S32, {{Sgpr32}, {Sgpr32}})
1439 .Div(S32, {{Vgpr32}, {Vgpr32}})
1440 .Uni(S64, {{Sgpr64}, {Sgpr64}})
1441 .Div(S64, {{Vgpr64}, {Vgpr64}});
1442
1443 addRulesForGOpcs({G_AMDGPU_FFBH_U32, G_AMDGPU_FFBL_B32, G_CTLZ_ZERO_POISON,
1444 G_CTTZ_ZERO_POISON})
1445 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}})
1446 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1447 .Any({{UniS32, S64}, {{Sgpr32}, {Sgpr64}}})
1449
1450 addRulesForGOpcs({G_CTPOP})
1451 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}})
1452 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1453 .Any({{UniS32, S64}, {{Sgpr32}, {Sgpr64}}})
1454 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}, CtPop64To32}});
1455
1456 addRulesForGOpcs({G_FENCE}).Any({{{}}, {{}, {}}});
1457
1458 addRulesForGOpcs({G_READSTEADYCOUNTER, G_READCYCLECOUNTER}, Standard)
1459 .Uni(S64, {{Sgpr64}, {}});
1460
1461 addRulesForGOpcs({G_GET_ROUNDING}, Standard)
1462 .Uni(S32, {{Sgpr32}, {}, LowerGetRounding});
1463
1464 addRulesForGOpcs({G_SET_ROUNDING}, Standard)
1467
1468 addRulesForGOpcs({G_BLOCK_ADDR}).Any({{UniP0}, {{SgprP0}, {}}});
1469
1470 addRulesForGOpcs({G_GLOBAL_VALUE})
1471 .Any({{UniP0}, {{SgprP0}, {}}})
1472 .Any({{UniP1}, {{SgprP1}, {}}})
1473 .Any({{UniP3}, {{SgprP3}, {}}})
1474 .Any({{UniP4}, {{SgprP4}, {}}})
1475 .Any({{UniP8}, {{SgprP8}, {}}});
1476
1477 addRulesForGOpcs({G_AMDGPU_WAVE_ADDRESS}).Any({{UniP5}, {{SgprP5}, {}}});
1478
1479 addRulesForGOpcs({G_AMDGPU_SPONENTRY}, Standard).Uni(S32, {{Sgpr32}, {}});
1480
1481 addRulesForGOpcs({G_SI_CALL})
1482 .Any({{_, UniP0}, {{None}, {SgprP0}}})
1483 .Any({{_, DivP0}, {{None}, {SgprP0Call_WF}}})
1484 .Any({{_, UniP4}, {{None}, {SgprP4}}})
1485 .Any({{_, DivP4}, {{None}, {SgprP4Call_WF}}});
1486
1487 bool hasSALUFloat = ST->hasSALUFloatInsts();
1488
1489 addRulesForGOpcs({G_FADD, G_FMUL, G_STRICT_FADD, G_STRICT_FMUL}, Standard)
1490 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUFloat)
1491 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUFloat)
1492 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1493 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUFloat)
1494 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUFloat)
1495 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1496 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
1497 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
1498 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16, VgprV2S16}}, !hasSALUFloat)
1500 hasSALUFloat)
1501 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
1505 .Any({{DivV2S64}, {{VgprV2S64}, {VgprV2S64, VgprV2S64}}});
1506
1507 addRulesForGOpcs({G_FSUB, G_STRICT_FSUB}, Standard)
1508 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1509 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1510 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUFloat)
1511 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUFloat)
1512 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUFloat)
1513 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUFloat);
1514
1515 addRulesForGOpcs({G_FMAD}, Standard)
1516 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16, Vgpr16}})
1517 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16, Vgpr16}})
1518 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
1519 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
1520
1521 addRulesForGOpcs({G_FLDEXP, G_STRICT_FLDEXP}, Standard)
1522 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}})
1523 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1524 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}})
1525 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1526 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr32}})
1527 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr32}});
1528
1529 addRulesForGOpcs({G_FMA, G_STRICT_FMA}, Standard)
1530 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16, Vgpr16}})
1531 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}})
1532 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64, Vgpr64}})
1533 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64, Vgpr64}})
1537 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16, Sgpr16}}, hasSALUFloat)
1538 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16, Vgpr16}}, !hasSALUFloat)
1539 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32, Sgpr32}}, hasSALUFloat)
1540 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}}, !hasSALUFloat)
1541 .Uni(V2S16,
1543 hasSALUFloat)
1545 !hasSALUFloat)
1548
1549 addRulesForGOpcs({G_AMDGPU_FMED3}, Standard)
1550 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16, Vgpr16}})
1551 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16, Vgpr16}})
1552 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
1553 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
1554
1555 // TODO: This opcode is generated from the i64->i16 signed clamped pattern in
1556 // the PreLegalizerCombiner. Move the combine to RegBankCombiner to keep more
1557 // instructions on SALU.
1558 addRulesForGOpcs({G_AMDGPU_SMED3}, Standard)
1559 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32, Vgpr32}})
1560 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32, Vgpr32}});
1561
1562 // FNEG and FABS are either folded as source modifiers or can be selected as
1563 // bitwise XOR and AND with Mask. XOR and AND are available on SALU but for
1564 // targets without SALU float we still select them as VGPR since there would
1565 // be no real sgpr use.
1566 addRulesForGOpcs({G_FNEG, G_FABS}, Standard)
1567 .Uni(S16, {{UniInVgprS16}, {Vgpr16}}, !hasSALUFloat)
1568 .Uni(S16, {{Sgpr16}, {Sgpr16}}, hasSALUFloat)
1569 .Div(S16, {{Vgpr16}, {Vgpr16}})
1570 .Uni(S32, {{UniInVgprS32}, {Vgpr32}}, !hasSALUFloat)
1571 .Uni(S32, {{Sgpr32}, {Sgpr32}}, hasSALUFloat)
1572 .Div(S32, {{Vgpr32}, {Vgpr32}})
1573 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1574 .Div(S64, {{Vgpr64}, {Vgpr64}})
1575 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16}}, !hasSALUFloat)
1576 .Uni(V2S16, {{SgprV2S16}, {SgprV2S16}, ScalarizeToS16}, hasSALUFloat)
1577 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}})
1578 .Any({{UniV2S32}, {{UniInVgprV2S32}, {VgprV2S32}}})
1579 .Any({{DivV2S32}, {{VgprV2S32}, {VgprV2S32}}});
1580
1581 addRulesForGOpcs({G_FCANONICALIZE}, Standard)
1582 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
1583 .Div(S32, {{Vgpr32}, {Vgpr32}})
1584 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
1585 .Div(S16, {{Vgpr16}, {Vgpr16}})
1586 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1587 .Div(S64, {{Vgpr64}, {Vgpr64}})
1588 .Uni(V2S16, {{UniInVgprV2S16}, {VgprV2S16}})
1589 .Div(V2S16, {{VgprV2S16}, {VgprV2S16}})
1590 .Any({{UniV2S32}, {{UniInVgprV2S32}, {VgprV2S32}}})
1591 .Any({{DivV2S32}, {{VgprV2S32}, {VgprV2S32}}})
1592 .Any({{UniV2S64}, {{UniInVgprV2S64}, {VgprV2S64}}})
1593 .Any({{DivV2S64}, {{VgprV2S64}, {VgprV2S64}}});
1594
1595 bool hasPST = ST->hasPseudoScalarTrans();
1596 // Only 16-bit G_FSQRT operations are legal. F32/F64 is handled with a custom
1597 // legalization in the legalizer.
1598 addRulesForGOpcs({G_FSQRT})
1599 .Any({{DivS16}, {{Vgpr16}, {Vgpr16}}})
1600 .Any({{UniBF16}, {{UniInVgprS16}, {Vgpr16}}})
1601 .Any({{UniS16}, {{Sgpr16}, {Sgpr16}}}, hasPST)
1602 .Any({{UniS16}, {{UniInVgprS16}, {Vgpr16}}}, !hasPST);
1603
1604 addRulesForGOpcs({G_FPTOUI, G_FPTOSI, G_FPTOUI_SAT, G_FPTOSI_SAT})
1605 .Any({{UniS16, S16}, {{UniInVgprS16}, {Vgpr16}}})
1606 .Any({{DivS16, S16}, {{Vgpr16}, {Vgpr16}}})
1607 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}}, hasSALUFloat)
1608 .Any({{UniS32, S16}, {{UniInVgprS32}, {Vgpr16}}}, !hasSALUFloat)
1609 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}})
1610 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1611 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat)
1612 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1613 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}}, hasSALUFloat)
1614 .Any({{UniS32, S32}, {{UniInVgprS32}, {Vgpr32}}}, !hasSALUFloat)
1615 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1616 .Any({{UniS32, S64}, {{UniInVgprS32}, {Vgpr64}}})
1617 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}}})
1619 .Any({{DivV2S16, V2S32}, {{VgprV2S16}, {VgprV2S32}}});
1620
1621 addRulesForGOpcs({G_UITOFP, G_SITOFP})
1622 .Any({{UniS16, S16}, {{UniInVgprS16}, {Vgpr16}}})
1623 .Any({{DivS16, S16}, {{Vgpr16}, {Vgpr16}}})
1624 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1625 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat)
1626 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1627 .Any({{UniS32, S32}, {{Sgpr32}, {Sgpr32}}}, hasSALUFloat)
1628 .Any({{UniS32, S32}, {{UniInVgprS32}, {Vgpr32}}}, !hasSALUFloat)
1629 .Any({{DivS32, S32}, {{Vgpr32}, {Vgpr32}}})
1630 .Any({{UniS64, S32}, {{UniInVgprS64}, {Vgpr32}}})
1631 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}}});
1632
1633 addRulesForGOpcs({G_AMDGPU_S_BUFFER_PREFETCH})
1635
1636 Predicate IsDataPF([](const MachineInstr &MI) -> bool {
1637 // prefetch cache type: 0 == instruction (I$) prefetch, 1 == data prefetch.
1638 return MI.getOperand(3).getImm() != 0;
1639 });
1640
1641 bool HasSMemPF = ST->hasSafeSmemPrefetch();
1642 bool HasVMemPF = ST->hasVmemPrefInsts();
1643 addRulesForGOpcs({G_PREFETCH})
1644 // Safe smem prefetch keeps both data and instruction prefetch.
1645 .Any({{UniPtr64}, {{}, {SgprPtr64}}}, HasSMemPF)
1646 // Vmem prefetch keeps data prefetch only.
1647 .Any({{{UniPtr64}, IsDataPF}, {{}, {SgprPtr64}}}, !HasSMemPF && HasVMemPF)
1648 .Any({{{UniPtr64}, IsDataPF}, {{}, {}, DeletePrefetch}},
1649 !HasSMemPF && !HasVMemPF)
1650 .Any({{{UniPtr64}, !IsDataPF}, {{}, {}, DeletePrefetch}}, !HasSMemPF)
1651
1652 .Any({{{DivPtr64}, IsDataPF}, {{}, {VgprPtr64}}}, HasVMemPF)
1653 .Any({{{DivPtr64}, IsDataPF}, {{}, {}, DeletePrefetch}}, !HasVMemPF)
1654 .Any({{{DivPtr64}, !IsDataPF}, {{}, {}, DeletePrefetch}})
1655
1656 .Any({{P3}, {{}, {}, DeletePrefetch}})
1657 .Any({{P5}, {{}, {}, DeletePrefetch}})
1658 .Any({{UniP6}, {{}, {SgprP6}}}, HasSMemPF)
1659 .Any({{UniP6}, {{}, {}, DeletePrefetch}}, !HasSMemPF);
1660
1661 addRulesForGOpcs({G_FPEXT})
1662 .Any({{DivS32, S16}, {{Vgpr32}, {Vgpr16}}})
1663 .Any({{UniS64, S32}, {{UniInVgprS64}, {Vgpr32}}})
1664 .Any({{DivS64, S32}, {{Vgpr64}, {Vgpr32}}})
1665 .Any({{UniS32, S16}, {{Sgpr32}, {Sgpr16}}}, hasSALUFloat)
1666 .Any({{UniS32, S16}, {{UniInVgprS32}, {Vgpr16}}}, !hasSALUFloat);
1667
1668 addRulesForGOpcs({G_AMDGPU_CVT_PK_I16_I32}, Standard)
1669 .Uni(V2S16, {{UniInVgprV2S16}, {Vgpr32, Vgpr32}})
1670 .Div(V2S16, {{VgprV2S16}, {Vgpr32, Vgpr32}});
1671
1672 addRulesForGOpcs({G_AMDGPU_FMIN_LEGACY, G_AMDGPU_FMAX_LEGACY}, Standard)
1673 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}})
1674 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}});
1675
1676 bool hasSALUMinimumMaximumInsts = ST->hasSALUMinimumMaximumInsts();
1677
1678 addRulesForGOpcs({G_FMINIMUM, G_FMAXIMUM}, Standard)
1679 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUMinimumMaximumInsts)
1680 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUMinimumMaximumInsts)
1681 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1682 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUMinimumMaximumInsts)
1683 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUMinimumMaximumInsts)
1684 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1685 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
1686 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
1688 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}});
1689
1690 addRulesForGOpcs({G_FMINNUM_IEEE, G_FMAXNUM_IEEE, G_FMINNUM, G_FMAXNUM,
1691 G_FMINIMUMNUM, G_FMAXIMUMNUM},
1692 Standard)
1693 .Div(S16, {{Vgpr16}, {Vgpr16, Vgpr16}})
1694 .Div(S32, {{Vgpr32}, {Vgpr32, Vgpr32}})
1695 .Uni(S64, {{UniInVgprS64}, {Vgpr64, Vgpr64}})
1696 .Div(S64, {{Vgpr64}, {Vgpr64, Vgpr64}})
1698 .Div(V2S16, {{VgprV2S16}, {VgprV2S16, VgprV2S16}})
1699 .Uni(S16, {{Sgpr16}, {Sgpr16, Sgpr16}}, hasSALUFloat)
1700 .Uni(S16, {{UniInVgprS16}, {Vgpr16, Vgpr16}}, !hasSALUFloat)
1701 .Uni(S32, {{Sgpr32}, {Sgpr32, Sgpr32}}, hasSALUFloat)
1702 .Uni(S32, {{UniInVgprS32}, {Vgpr32, Vgpr32}}, !hasSALUFloat);
1703
1704 addRulesForGOpcs({G_FPTRUNC})
1705 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1706 .Any({{UniS32, S64}, {{UniInVgprS32}, {Vgpr64}}})
1707 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}}})
1709 .Any({{DivV2S16, V2S32}, {{VgprV2S16}, {VgprV2S32}}})
1710 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1711 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat);
1712
1713 addRulesForGOpcs({G_INTRINSIC_FPTRUNC_ROUND})
1714 .Any({{UniS16, S32}, {{Sgpr16}, {Sgpr32}}}, hasSALUFloat)
1715 .Any({{UniS16, S32}, {{UniInVgprS16}, {Vgpr32}}}, !hasSALUFloat)
1716 .Any({{DivS16, S32}, {{Vgpr16}, {Vgpr32}}})
1717 .Any({{UniS16, S64}, {{UniInVgprS16}, {Vgpr64}}})
1718 .Any({{DivS16, S64}, {{Vgpr16}, {Vgpr64}}})
1719 .Any({{UniS32, S64}, {{UniInVgprS32}, {Vgpr64}}})
1720 .Any({{DivS32, S64}, {{Vgpr32}, {Vgpr64}}});
1721
1722 addRulesForGOpcs({G_IS_FPCLASS})
1723 .Any({{DivS1, S16}, {{Vcc}, {Vgpr16}}})
1724 .Any({{UniS1, S16}, {{UniInVcc}, {Vgpr16}}})
1725 .Any({{DivS1, S32}, {{Vcc}, {Vgpr32}}})
1726 .Any({{UniS1, S32}, {{UniInVcc}, {Vgpr32}}})
1727 .Any({{DivS1, S64}, {{Vcc}, {Vgpr64}}})
1728 .Any({{UniS1, S64}, {{UniInVcc}, {Vgpr64}}});
1729
1730 addRulesForGOpcs({G_FCMP}, Standard)
1731 .Any({{UniS1, _, S16}, {{Sgpr32Trunc}, {None, Sgpr16, Sgpr16}}},
1732 hasSALUFloat)
1733 .Any({{UniS1, _, S16}, {{UniInVcc}, {None, Vgpr16, Vgpr16}}},
1734 !hasSALUFloat)
1735 .Any({{DivS1, _, S16}, {{Vcc}, {None, Vgpr16, Vgpr16}}})
1736 .Any({{UniS1, _, S32}, {{Sgpr32Trunc}, {None, Sgpr32, Sgpr32}}},
1737 hasSALUFloat)
1738 .Any({{UniS1, _, S32}, {{UniInVcc}, {None, Vgpr32, Vgpr32}}},
1739 !hasSALUFloat)
1740 .Any({{DivS1, _, S32}, {{Vcc}, {None, Vgpr32, Vgpr32}}})
1741 .Any({{UniS1, _, S64}, {{UniInVcc}, {None, Vgpr64, Vgpr64}}})
1742 .Any({{DivS1, _, S64}, {{Vcc}, {None, Vgpr64, Vgpr64}}});
1743
1744 addRulesForGOpcs({G_INTRINSIC_ROUNDEVEN, G_FEXP2, G_FLOG2}, Standard)
1745 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
1746 .Div(S16, {{Vgpr16}, {Vgpr16}})
1747 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
1748 .Div(S32, {{Vgpr32}, {Vgpr32}})
1749 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1750 .Div(S64, {{Vgpr64}, {Vgpr64}});
1751
1752 addRulesForGOpcs({G_INTRINSIC_TRUNC, G_FFLOOR, G_FCEIL}, Standard)
1753 .Uni(S16, {{UniInVgprS16}, {Vgpr16}})
1754 .Uni(S16, {{Sgpr16}, {Sgpr16}}, hasSALUFloat)
1755 .Div(S16, {{Vgpr16}, {Vgpr16}})
1756 .Uni(S32, {{UniInVgprS32}, {Vgpr32}})
1757 .Uni(S32, {{Sgpr32}, {Sgpr32}}, hasSALUFloat)
1758 .Div(S32, {{Vgpr32}, {Vgpr32}})
1759 .Uni(S64, {{UniInVgprS64}, {Vgpr64}})
1760 .Div(S64, {{Vgpr64}, {Vgpr64}});
1761
1762 addRulesForGOpcs({G_AMDGPU_GLOBAL_LOAD_MONITOR, G_AMDGPU_FLAT_LOAD_MONITOR},
1763 StandardB)
1764 .Uni(B32, {{UniInVgprB32}, {SgprPtr64}})
1765 .Div(B32, {{VgprB32}, {VgprPtr64}})
1766 .Uni(B64, {{UniInVgprB64}, {SgprPtr64}})
1767 .Div(B64, {{VgprB64}, {VgprPtr64}})
1768 .Uni(B128, {{UniInVgprB128}, {SgprPtr64}})
1769 .Div(B128, {{VgprB128}, {VgprPtr64}});
1770
1771 addRulesForGOpcs({G_AMDGPU_WHOLE_WAVE_FUNC_SETUP})
1772 .Any({{DivS1}, {{Vcc}, {}}});
1773
1774 addRulesForGOpcs({G_AMDGPU_WHOLE_WAVE_FUNC_RETURN}).Any({{}, {{}, {Vcc}}});
1775
1776 using namespace Intrinsic;
1777
1778 addRulesForIOpcs({returnaddress}).Any({{UniP0}, {{SgprP0}, {}}});
1779
1780 addRulesForIOpcs({amdgcn_s_getpc}).Any({{UniS64, _}, {{Sgpr64}, {}}});
1781
1782 addRulesForIOpcs({amdgcn_s_getreg}).Any({{}, {{Sgpr32}, {IntrId}}});
1783
1784 addRulesForIOpcs({amdgcn_s_setreg})
1785 .Any({{_, _, S32}, {{}, {IntrId, Imm, SgprB32_ReadFirstLane}}});
1786
1787 addRulesForIOpcs({amdgcn_s_sendmsg, amdgcn_s_sendmsghalt})
1788 .Any({{}, {{}, {IntrId, Imm, SgprB32_M0}}});
1789
1790 addRulesForIOpcs({amdgcn_s_sendmsg_rtn})
1791 .Any({{S32}, {{Sgpr32}, {}}})
1792 .Any({{S64}, {{Sgpr64}, {}}});
1793
1794 addRulesForIOpcs({amdgcn_s_memrealtime, amdgcn_s_memtime}, Standard)
1795 .Uni(S64, {{Sgpr64}, {IntrId}});
1796
1797 addRulesForIOpcs({amdgcn_groupstaticsize, amdgcn_pops_exiting_wave_id,
1798 amdgcn_reloc_constant, amdgcn_s_get_waveid_in_workgroup},
1799 Standard)
1800 .Uni(S32, {{Sgpr32}, {IntrId}});
1801
1802 // Intrinsics with no register operands.
1803 addRulesForIOpcs({amdgcn_asyncmark,
1804 amdgcn_endpgm,
1805 amdgcn_iglp_opt,
1806 amdgcn_init_exec,
1807 amdgcn_s_barrier,
1808 amdgcn_s_barrier_leave,
1809 amdgcn_s_barrier_signal,
1810 amdgcn_s_barrier_wait,
1811 amdgcn_s_decperflevel,
1812 amdgcn_s_incperflevel,
1813 amdgcn_s_monitor_sleep,
1814 amdgcn_s_nop,
1815 amdgcn_s_sethalt,
1816 amdgcn_s_setprio,
1817 amdgcn_s_setprio_inc_wg,
1818 amdgcn_s_sleep,
1819 amdgcn_s_ttracedata_imm,
1820 amdgcn_s_wait_asynccnt,
1821 amdgcn_s_wait_bvhcnt,
1822 amdgcn_s_wait_dscnt,
1823 amdgcn_s_wait_event,
1824 amdgcn_s_wait_event_export_ready,
1825 amdgcn_s_wait_expcnt,
1826 amdgcn_s_wait_kmcnt,
1827 amdgcn_s_wait_loadcnt,
1828 amdgcn_s_wait_samplecnt,
1829 amdgcn_s_wait_storecnt,
1830 amdgcn_s_wait_tensorcnt,
1831 amdgcn_s_waitcnt,
1832 amdgcn_sched_barrier,
1833 amdgcn_sched_group_barrier,
1834 amdgcn_unreachable,
1835 amdgcn_wait_asyncmark,
1836 amdgcn_wave_barrier})
1837 .Any({{}, {{}, {}}});
1838
1839 addRulesForIOpcs({amdgcn_init_exec_from_input})
1840 .Any({{}, {{}, {IntrId, Sgpr32}}});
1841
1842 addRulesForIOpcs({amdgcn_s_ttracedata}).Any({{}, {{}, {IntrId, SgprB32_M0}}});
1843
1844 addRulesForIOpcs({amdgcn_s_sleep_var})
1845 .Any({{}, {{}, {IntrId, SgprB32_ReadFirstLane}}});
1846
1847 addRulesForIOpcs({amdgcn_s_barrier_join, amdgcn_s_wakeup_barrier})
1848 .Any({{}, {{}, {IntrId, SgprB32_M0}}});
1849
1850 addRulesForIOpcs({amdgcn_s_barrier_signal_var, amdgcn_s_barrier_init})
1851 .Any({{}, {{}, {IntrId, SgprB32_M0, SgprB32_M0}}});
1852
1853 addRulesForIOpcs({amdgcn_s_barrier_signal_isfirst})
1854 .Any({{UniS1}, {{Sgpr32Trunc}, {}}});
1855
1856 addRulesForIOpcs(
1857 {amdgcn_s_get_named_barrier_state, amdgcn_s_get_barrier_state}, Standard)
1858 .Uni(S32, {{Sgpr32}, {IntrId, SgprB32_M0}});
1859
1860 addRulesForIOpcs({amdgcn_flat_prefetch}).Any({{}, {{}, {IntrId, VgprP0}}});
1861
1862 addRulesForIOpcs({amdgcn_global_prefetch}).Any({{}, {{}, {IntrId, VgprP1}}});
1863
1864 addRulesForIOpcs({amdgcn_s_prefetch_data, amdgcn_s_prefetch_inst})
1866
1867 addRulesForIOpcs({amdgcn_class})
1868 .Any({{UniS1, _, S16}, {{UniInVcc}, {IntrId, Vgpr16, Vgpr32}}})
1869 .Any({{DivS1, _, S16}, {{Vcc}, {IntrId, Vgpr16, Vgpr32}}})
1870 .Any({{UniS1, _, S32}, {{UniInVcc}, {IntrId, Vgpr32, Vgpr32}}})
1871 .Any({{DivS1, _, S32}, {{Vcc}, {IntrId, Vgpr32, Vgpr32}}})
1872 .Any({{UniS1, _, S64}, {{UniInVcc}, {IntrId, Vgpr64, Vgpr32}}})
1873 .Any({{DivS1, _, S64}, {{Vcc}, {IntrId, Vgpr64, Vgpr32}}});
1874
1875 // This is "intrinsic lane mask" it was set to i32/i64 in llvm-ir.
1876 addRulesForIOpcs({amdgcn_end_cf})
1877 .Any({{_, UniS32}, {{}, {IntrId, Sgpr32}}})
1878 .Any({{_, UniS64}, {{}, {IntrId, Sgpr64}}});
1879
1880 addRulesForIOpcs({amdgcn_if_break}, Standard)
1881 .Uni(S64, {{Sgpr64}, {IntrId, Vcc, Sgpr64}})
1882 .Uni(S32, {{Sgpr32}, {IntrId, Vcc, Sgpr32}});
1883
1884 addRulesForIOpcs({amdgcn_exp})
1885 .Any({{_, _, _, S32, S32, S32, S32},
1886 {{}, {IntrId, Imm, Imm, Vgpr32, Vgpr32, Vgpr32, Vgpr32}}});
1887
1888 addRulesForIOpcs({amdgcn_exp_compr})
1889 .Any({{_, _, _, V2S16}, {{}, {IntrId, Imm, Imm, VgprV2S16, VgprV2S16}}});
1890
1891 addRulesForIOpcs({amdgcn_exp_row})
1892 .Any({{_, _, _, S32, S32, S32, S32, _, S32},
1893 {{},
1895 SgprB32_M0}}});
1896
1897 addRulesForIOpcs({amdgcn_lds_direct_load}, StandardB)
1898 .Div(B32, {{VgprB32}, {IntrId, SgprB32_M0}});
1899
1900 addRulesForIOpcs({amdgcn_lds_param_load}, Standard)
1901 .Div(S32, {{Vgpr32}, {IntrId, Imm, Imm, SgprB32_M0}});
1902
1903 addRulesForIOpcs({amdgcn_mbcnt_lo, amdgcn_mbcnt_hi}, Standard)
1904 .Div(S32, {{}, {Vgpr32, None, Vgpr32, Vgpr32}});
1905
1906 addRulesForIOpcs({amdgcn_readfirstlane})
1907 .Any({{UniB32, _, DivB32}, {{}, {SgprB32, None, VgprB32}}})
1908 // this should not exist in the first place, it is from call lowering
1909 // readfirstlaning just in case register is not in sgpr.
1910 .Any({{UniS32, _, UniS32}, {{}, {Sgpr32, None, Vgpr32}}});
1911
1912 addRulesForIOpcs({amdgcn_readlane}, StandardB)
1914
1915 addRulesForIOpcs({amdgcn_s_quadmask, amdgcn_s_wqm}, StandardB)
1917 .Uni(B64, {{SgprB64}, {IntrId, SgprB64_ReadFirstLane}});
1918
1919 addRulesForIOpcs({amdgcn_writelane}, StandardB)
1920 .Div(B32,
1921 {{VgprB32},
1923
1924 addRulesForIOpcs({amdgcn_add_max_i32, amdgcn_add_max_u32, amdgcn_add_min_i32,
1925 amdgcn_add_min_u32},
1926 Standard)
1927 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1928 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1929
1930 addRulesForIOpcs({amdgcn_pk_add_max_i16, amdgcn_pk_add_max_u16,
1931 amdgcn_pk_add_min_i16, amdgcn_pk_add_min_u16},
1932 Standard)
1935
1936 addRulesForIOpcs({amdgcn_permlane16, amdgcn_permlanex16}, StandardB)
1937 .Div(B32, {{VgprB32},
1940
1941 addRulesForIOpcs({amdgcn_permlane_bcast, amdgcn_permlane_up,
1942 amdgcn_permlane_down, amdgcn_permlane_xor},
1943 StandardB)
1944 .Div(B32,
1945 {{VgprB32},
1947
1948 addRulesForIOpcs({amdgcn_permlane_idx_gen}, Standard)
1950
1951 addRulesForIOpcs({amdgcn_alignbyte, amdgcn_perm}, Standard)
1952 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1953 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1954
1955 addRulesForIOpcs({amdgcn_mqsad_pk_u16_u8, amdgcn_qsad_pk_u16_u8}, Standard)
1956 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr32, Vgpr64}})
1957 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr32, Vgpr64}});
1958
1959 addRulesForIOpcs({amdgcn_mqsad_u32_u8})
1960 .Any(
1963
1964 addRulesForIOpcs({amdgcn_lerp}, Standard)
1965 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1966 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1967
1968 addRulesForIOpcs(
1969 {amdgcn_msad_u8, amdgcn_sad_hi_u8, amdgcn_sad_u16, amdgcn_sad_u8},
1970 Standard)
1971 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1972 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1973
1974 addRulesForIOpcs(
1975 {amdgcn_wave_reduce_add, amdgcn_wave_reduce_and, amdgcn_wave_reduce_fadd,
1976 amdgcn_wave_reduce_fmax, amdgcn_wave_reduce_fmin,
1977 amdgcn_wave_reduce_fsub, amdgcn_wave_reduce_max, amdgcn_wave_reduce_min,
1978 amdgcn_wave_reduce_or, amdgcn_wave_reduce_sub, amdgcn_wave_reduce_umax,
1979 amdgcn_wave_reduce_umin, amdgcn_wave_reduce_xor},
1980 Standard)
1981 .Uni(S32, {{Sgpr32}, {IntrId, Sgpr32}})
1982 .Div(S32, {{Sgpr32ToVgprDst}, {IntrId, VgprB32}})
1983 .Uni(S64, {{Sgpr64}, {IntrId, Sgpr64}})
1984 .Div(S64, {{Sgpr64ToVgprDst}, {IntrId, VgprB64}});
1985
1986 addRulesForIOpcs({amdgcn_wave_shuffle}, Standard)
1987 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}})
1988 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
1989
1990 addRulesForIOpcs({amdgcn_bitop3, amdgcn_fmad_ftz}, Standard)
1991 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
1992 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
1993 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
1994 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
1995
1996 addRulesForIOpcs({amdgcn_udot4, amdgcn_sdot4, amdgcn_udot8, amdgcn_sdot8,
1997 amdgcn_dot4_f32_bf8_bf8, amdgcn_dot4_f32_bf8_fp8,
1998 amdgcn_dot4_f32_fp8_fp8, amdgcn_dot4_f32_fp8_bf8},
1999 Standard)
2000 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2001 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2002
2003 addRulesForIOpcs({amdgcn_rsq, amdgcn_rsq_clamp})
2004 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2005 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2006 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2007 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2008 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2009 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST)
2010 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2011 .Any({{UniS64}, {{UniInVgprS64}, {IntrId, Vgpr64}}})
2012 .Any({{DivS64}, {{Vgpr64}, {IntrId, Vgpr64}}});
2013
2014 addRulesForIOpcs({amdgcn_mul_u24, amdgcn_mul_i24}, Standard)
2015 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}})
2016 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}})
2017 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr32, Vgpr32}})
2018 .Div(S64, {{Vgpr64}, {IntrId, Vgpr32, Vgpr32}});
2019
2020 addRulesForIOpcs({amdgcn_ds_bpermute, amdgcn_ds_bpermute_fi_b32,
2021 amdgcn_ds_permute, amdgcn_fmul_legacy, amdgcn_mulhi_i24,
2022 amdgcn_mulhi_u24},
2023 Standard)
2024 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}})
2025 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
2026
2027 addRulesForIOpcs({amdgcn_cvt_sr_bf8_f32, amdgcn_cvt_sr_fp8_f32,
2028 amdgcn_cvt_sr_fp8_f32_e5m3, amdgcn_cvt_pk_bf8_f32,
2029 amdgcn_cvt_pk_fp8_f32, amdgcn_cvt_pk_fp8_f32_e5m3,
2030 amdgcn_cvt_pk_u8_f32},
2031 Standard)
2032 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2033 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2034
2035 addRulesForIOpcs({amdgcn_cvt_off_f32_i4, amdgcn_cvt_f32_bf8,
2036 amdgcn_cvt_f32_fp8, amdgcn_cvt_f32_fp8_e5m3},
2037 Standard)
2038 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}})
2039 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}});
2040
2041 addRulesForIOpcs({amdgcn_cvt_pk_f32_bf8, amdgcn_cvt_pk_f32_fp8})
2042 .Any({{UniV2S32}, {{UniInVgprV2S32}, {IntrId, Vgpr32}}})
2043 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, Vgpr32}}});
2044
2045 addRulesForIOpcs({amdgcn_cvt_f16_bf8, amdgcn_cvt_f16_fp8}, Standard)
2046 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr32}})
2047 .Div(S16, {{Vgpr16}, {IntrId, Vgpr32}});
2048
2049 addRulesForIOpcs({amdgcn_cvt_pk_f16_bf8, amdgcn_cvt_pk_f16_fp8}, Standard)
2050 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr16}})
2051 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr16}});
2052
2053 addRulesForIOpcs({amdgcn_cvt_pk_bf8_f16, amdgcn_cvt_pk_fp8_f16}, Standard)
2054 .Uni(S16, {{UniInVgprS16}, {IntrId, VgprV2S16}})
2055 .Div(S16, {{Vgpr16}, {IntrId, VgprV2S16}});
2056
2057 addRulesForIOpcs({amdgcn_cvt_sr_bf8_f16, amdgcn_cvt_sr_fp8_f16}, Standard)
2058 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr16, Vgpr32, Vgpr32}})
2059 .Div(S32, {{Vgpr32}, {IntrId, Vgpr16, Vgpr32, Vgpr32}});
2060
2061 addRulesForIOpcs({amdgcn_cvt_sr_pk_f16_f32, amdgcn_cvt_sr_pk_bf16_f32},
2062 Standard)
2064 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2065
2066 addRulesForIOpcs(
2067 {amdgcn_cvt_scalef32_sr_fp8_f16, amdgcn_cvt_scalef32_sr_bf8_f16,
2068 amdgcn_cvt_scalef32_sr_fp8_bf16, amdgcn_cvt_scalef32_sr_bf8_bf16})
2069 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32, Vgpr16, Vgpr32, Vgpr32}}})
2070 .Any({{UniS32},
2072
2073 addRulesForIOpcs(
2074 {amdgcn_cvt_scalef32_sr_fp8_f32, amdgcn_cvt_scalef32_sr_bf8_f32})
2075 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vgpr32}}})
2076 .Any({{UniS32},
2078
2079 addRulesForIOpcs({amdgcn_cubesc, amdgcn_cubetc, amdgcn_cubema, amdgcn_cubeid,
2080 amdgcn_fma_legacy},
2081 Standard)
2082 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2083 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2084
2085 addRulesForIOpcs({amdgcn_frexp_mant, amdgcn_fract}, Standard)
2086 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16}})
2087 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16}})
2088 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}})
2089 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}})
2090 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64}})
2091 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64}});
2092
2093 addRulesForIOpcs({amdgcn_prng_b32})
2094 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}})
2095 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}});
2096
2097 addRulesForIOpcs({amdgcn_sffbh}, Standard)
2098 .Uni(S32, {{Sgpr32}, {IntrId, Sgpr32}})
2099 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}});
2100
2101 addRulesForIOpcs({amdgcn_ubfe, amdgcn_sbfe}, Standard)
2102 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2103 .Uni(S32, {{Sgpr32}, {IntrId, Sgpr32, Sgpr32, Sgpr32}, S_BFE})
2104 .Uni(S64, {{Sgpr64}, {IntrId, Sgpr64, Sgpr32, Sgpr32}, S_BFE})
2105 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr32, Vgpr32}, V_BFE});
2106
2107 addRulesForIOpcs({amdgcn_cvt_pk_i16, amdgcn_cvt_pk_u16, amdgcn_cvt_pknorm_i16,
2108 amdgcn_cvt_pknorm_u16},
2109 Standard)
2110 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr32, Vgpr32}})
2111 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32}});
2112
2113 addRulesForIOpcs({amdgcn_cvt_pkrtz}, Standard)
2114 .Uni(V2S16, {{SgprV2S16}, {IntrId, Sgpr32, Sgpr32}}, hasSALUFloat)
2115 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr32, Vgpr32}}, !hasSALUFloat)
2116 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32}});
2117
2118 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk32_bf6_f16,
2119 amdgcn_cvt_scalef32_sr_pk32_fp6_f16,
2120 amdgcn_cvt_scalef32_sr_pk32_bf6_bf16,
2121 amdgcn_cvt_scalef32_sr_pk32_fp6_bf16},
2122 Standard)
2124 .Any({{UniV6S32},
2126
2127 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk32_bf6_f32,
2128 amdgcn_cvt_scalef32_sr_pk32_fp6_f32},
2129 Standard)
2131 .Any({{UniV6S32},
2133
2134 addRulesForIOpcs(
2135 {amdgcn_cvt_scalef32_sr_pk_fp4_f16, amdgcn_cvt_scalef32_sr_pk_fp4_bf16},
2136 Standard)
2138 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, VgprV2S16, Vgpr32, Vgpr32}});
2139
2140 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk_fp4_f32}, Standard)
2142 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, VgprV2S32, Vgpr32, Vgpr32}});
2143
2144 addRulesForIOpcs(
2145 {amdgcn_cvt_scalef32_2xpk16_fp6_f32, amdgcn_cvt_scalef32_2xpk16_bf6_f32})
2146 .Any(
2148 .Any({{UniV6S32},
2150
2151 addRulesForIOpcs({amdgcn_cvt_scalef32_f16_fp8, amdgcn_cvt_scalef32_f16_bf8},
2152 Standard)
2153 .Div(V2S16, {{VgprV2S16}, {IntrId, VgprV2S16, Vgpr32, Vgpr32}})
2155
2156 addRulesForIOpcs({amdgcn_cvt_scalef32_f32_fp8, amdgcn_cvt_scalef32_f32_bf8},
2157 Standard)
2158 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}})
2159 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32}});
2160
2161 addRulesForIOpcs(
2162 {amdgcn_cvt_scalef32_pk16_bf6_f16, amdgcn_cvt_scalef32_pk16_fp6_f16,
2163 amdgcn_cvt_scalef32_pk16_bf6_bf16, amdgcn_cvt_scalef32_pk16_fp6_bf16},
2164 Standard)
2167
2168 addRulesForIOpcs(
2169 {amdgcn_cvt_scalef32_pk16_bf6_f32, amdgcn_cvt_scalef32_pk16_fp6_f32},
2170 Standard)
2173
2174 addRulesForIOpcs(
2175 {amdgcn_cvt_scalef32_pk8_bf8_f16, amdgcn_cvt_scalef32_pk8_fp8_f16,
2176 amdgcn_cvt_scalef32_pk8_bf8_bf16, amdgcn_cvt_scalef32_pk8_fp8_bf16},
2177 Standard)
2180
2181 addRulesForIOpcs(
2182 {amdgcn_cvt_scalef32_pk8_bf8_f32, amdgcn_cvt_scalef32_pk8_fp8_f32},
2183 Standard)
2186
2187 addRulesForIOpcs(
2188 {amdgcn_cvt_scalef32_pk8_fp4_f16, amdgcn_cvt_scalef32_pk8_fp4_bf16},
2189 Standard)
2190 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S16, Vgpr32}})
2191 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S16, Vgpr32}});
2192
2193 addRulesForIOpcs({amdgcn_cvt_scalef32_pk8_fp4_f32}, Standard)
2194 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S32, Vgpr32}})
2195 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S32, Vgpr32}});
2196
2197 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk16_bf6_f16,
2198 amdgcn_cvt_scalef32_sr_pk16_fp6_f16,
2199 amdgcn_cvt_scalef32_sr_pk16_bf6_bf16,
2200 amdgcn_cvt_scalef32_sr_pk16_fp6_bf16},
2201 Standard)
2203 .Any({{UniV3S32},
2205
2206 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk16_bf6_f32,
2207 amdgcn_cvt_scalef32_sr_pk16_fp6_f32},
2208 Standard)
2210 .Any({{UniV3S32},
2212
2213 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk8_bf8_f16,
2214 amdgcn_cvt_scalef32_sr_pk8_fp8_f16,
2215 amdgcn_cvt_scalef32_sr_pk8_bf8_bf16,
2216 amdgcn_cvt_scalef32_sr_pk8_fp8_bf16},
2217 Standard)
2219 .Any({{UniV2S32},
2221
2222 addRulesForIOpcs(
2223 {amdgcn_cvt_scalef32_sr_pk8_bf8_f32, amdgcn_cvt_scalef32_sr_pk8_fp8_f32},
2224 Standard)
2226 .Any({{UniV2S32},
2228
2229 addRulesForIOpcs(
2230 {amdgcn_cvt_scalef32_sr_pk8_fp4_f16, amdgcn_cvt_scalef32_sr_pk8_fp4_bf16},
2231 Standard)
2232 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S16, Vgpr32, Vgpr32}})
2233 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S16, Vgpr32, Vgpr32}});
2234
2235 addRulesForIOpcs({amdgcn_cvt_scalef32_sr_pk8_fp4_f32}, Standard)
2236 .Div(S32, {{Vgpr32}, {IntrId, VgprV8S32, Vgpr32, Vgpr32}})
2237 .Uni(S32, {{UniInVgprS32}, {IntrId, VgprV8S32, Vgpr32, Vgpr32}});
2238
2239 addRulesForIOpcs(
2240 {amdgcn_cvt_scale_pk16_f16_bf6, amdgcn_cvt_scale_pk16_f16_fp6,
2241 amdgcn_cvt_scale_pk16_bf16_bf6, amdgcn_cvt_scale_pk16_bf16_fp6},
2242 Standard)
2245
2246 addRulesForIOpcs(
2247 {amdgcn_cvt_scale_pk16_f32_bf6, amdgcn_cvt_scale_pk16_f32_fp6}, Standard)
2250
2251 addRulesForIOpcs({amdgcn_cvt_scale_pk8_f16_bf8, amdgcn_cvt_scale_pk8_f16_fp8,
2252 amdgcn_cvt_scale_pk8_bf16_bf8,
2253 amdgcn_cvt_scale_pk8_bf16_fp8},
2254 Standard)
2257
2258 addRulesForIOpcs(
2259 {amdgcn_cvt_scale_pk8_f16_fp4, amdgcn_cvt_scale_pk8_bf16_fp4}, Standard)
2260 .Any({{DivV8S16}, {{VgprV8S16}, {IntrId, Vgpr32, Vgpr32}}})
2262
2263 addRulesForIOpcs({amdgcn_cvt_scale_pk8_f32_bf8, amdgcn_cvt_scale_pk8_f32_fp8},
2264 Standard)
2267
2268 addRulesForIOpcs({amdgcn_cvt_scale_pk8_f32_fp4}, Standard)
2269 .Any({{DivV8S32}, {{VgprV8S32}, {IntrId, Vgpr32, Vgpr32}}})
2271
2272 addRulesForIOpcs(
2273 {amdgcn_cvt_scalef32_pk32_bf6_f16, amdgcn_cvt_scalef32_pk32_fp6_f16,
2274 amdgcn_cvt_scalef32_pk32_bf6_bf16, amdgcn_cvt_scalef32_pk32_fp6_bf16},
2275 Standard)
2278
2279 addRulesForIOpcs(
2280 {amdgcn_cvt_scalef32_pk32_bf6_f32, amdgcn_cvt_scalef32_pk32_fp6_f32},
2281 Standard)
2284
2285 addRulesForIOpcs(
2286 {amdgcn_cvt_scalef32_pk_fp8_f32, amdgcn_cvt_scalef32_pk_bf8_f32},
2287 Standard)
2289 .Uni(V2S16,
2291
2292 addRulesForIOpcs(
2293 {amdgcn_cvt_scalef32_pk_f32_fp8, amdgcn_cvt_scalef32_pk_f32_bf8},
2294 Standard)
2295 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, Vgpr32, Vgpr32}}})
2297
2298 addRulesForIOpcs(
2299 {amdgcn_cvt_scalef32_pk_fp8_f16, amdgcn_cvt_scalef32_pk_bf8_f16,
2300 amdgcn_cvt_scalef32_pk_fp8_bf16, amdgcn_cvt_scalef32_pk_bf8_bf16},
2301 Standard)
2304
2305 addRulesForIOpcs({amdgcn_cvt_scalef32_pk_f32_fp4}, Standard)
2306 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, Vgpr32, Vgpr32}}})
2308
2309 addRulesForIOpcs({amdgcn_cvt_scalef32_pk_fp4_f32}, Standard)
2310 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vgpr32}})
2311 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vgpr32}});
2312
2313 addRulesForIOpcs(
2314 {amdgcn_cvt_scalef32_pk_f16_fp4, amdgcn_cvt_scalef32_pk_f16_fp8,
2315 amdgcn_cvt_scalef32_pk_f16_bf8, amdgcn_cvt_scalef32_pk_bf16_fp4,
2316 amdgcn_cvt_scalef32_pk_bf16_fp8, amdgcn_cvt_scalef32_pk_bf16_bf8},
2317 Standard)
2318 .Div(V2S16, {{VgprV2S16}, {IntrId, Vgpr32, Vgpr32}})
2319 .Uni(V2S16, {{UniInVgprV2S16}, {IntrId, Vgpr32, Vgpr32}});
2320
2321 addRulesForIOpcs(
2322 {amdgcn_cvt_scalef32_pk32_f32_fp6, amdgcn_cvt_scalef32_pk32_f32_bf6},
2323 Standard)
2326
2327 addRulesForIOpcs(
2328 {amdgcn_cvt_scalef32_pk32_f16_fp6, amdgcn_cvt_scalef32_pk32_f16_bf6,
2329 amdgcn_cvt_scalef32_pk32_bf16_fp6, amdgcn_cvt_scalef32_pk32_bf16_bf6},
2330 Standard)
2333
2334 addRulesForIOpcs(
2335 {amdgcn_cvt_scalef32_pk_fp4_f16, amdgcn_cvt_scalef32_pk_fp4_bf16},
2336 Standard)
2337 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, VgprV2S16, Vgpr32}})
2338 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, VgprV2S16, Vgpr32}});
2339
2340 addRulesForIOpcs({amdgcn_global_load_tr_b64})
2341 .Any({{DivB64, _, UniP1}, {{VgprB64}, {IntrId, SgprP1}}})
2342 .Any({{DivB64, _, DivP1}, {{VgprB64}, {IntrId, VgprP1}}})
2343 .Any({{DivB32, _, UniP1}, {{VgprB32}, {IntrId, SgprP1}}})
2344 .Any({{DivB32, _, DivP1}, {{VgprB32}, {IntrId, VgprP1}}});
2345
2346 addRulesForIOpcs({amdgcn_global_load_tr_b128})
2347 .Any({{DivB64, _, UniP1}, {{VgprB64}, {IntrId, SgprP1}}})
2348 .Any({{DivB64, _, DivP1}, {{VgprB64}, {IntrId, VgprP1}}})
2349 .Any({{DivB128, _, UniP1}, {{VgprB128}, {IntrId, SgprP1}}})
2350 .Any({{DivB128, _, DivP1}, {{VgprB128}, {IntrId, VgprP1}}});
2351
2352 addRulesForIOpcs({amdgcn_global_load_tr4_b64})
2353 .Any({{DivV2S32, _, UniP1}, {{VgprV2S32}, {IntrId, SgprP1}}})
2354 .Any({{DivV2S32, _, DivP1}, {{VgprV2S32}, {IntrId, VgprP1}}});
2355
2356 addRulesForIOpcs({amdgcn_global_load_tr6_b96})
2357 .Any({{DivV3S32, _, UniP1}, {{VgprV3S32}, {IntrId, SgprP1}}})
2358 .Any({{DivV3S32, _, DivP1}, {{VgprV3S32}, {IntrId, VgprP1}}});
2359
2360 addRulesForIOpcs({amdgcn_ds_load_tr4_b64, amdgcn_ds_load_tr8_b64})
2361 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, VgprP3}}});
2362
2363 addRulesForIOpcs({amdgcn_ds_load_tr6_b96})
2364 .Any({{DivV3S32}, {{VgprV3S32}, {IntrId, VgprP3}}});
2365
2366 addRulesForIOpcs({amdgcn_ds_load_tr16_b128})
2367 .Any({{DivB128}, {{VgprB128}, {IntrId, VgprP3}}});
2368
2369 addRulesForIOpcs({amdgcn_global_atomic_ordered_add_b64})
2370 .Any({{DivS64}, {{Vgpr64}, {IntrId, VgprP1, Vgpr64}}});
2371
2372 addRulesForIOpcs(
2373 {amdgcn_global_atomic_fmin_num, amdgcn_global_atomic_fmax_num}, Standard)
2374 .Div(S32, {{Vgpr32}, {IntrId, VgprP1, Vgpr32}});
2375
2376 addRulesForIOpcs({amdgcn_flat_atomic_fmin_num, amdgcn_flat_atomic_fmax_num},
2377 Standard)
2378 .Div(S32, {{Vgpr32}, {IntrId, VgprP0, Vgpr32}});
2379
2380 addRulesForIOpcs({amdgcn_raw_buffer_load_lds})
2381 .Any({{_}, {{}, {IntrId, SgprV4S32, SgprP3, Imm, Vgpr32, Sgpr32}}});
2382
2383 addRulesForIOpcs({amdgcn_raw_buffer_load_async_lds})
2384 .Any({{_}, {{}, {IntrId, SgprV4S32, SgprB32_M0, Imm, Vgpr32, Sgpr32}}});
2385
2386 addRulesForIOpcs({amdgcn_struct_buffer_load_async_lds})
2387 .Any(
2388 {{_},
2390
2391 addRulesForIOpcs({amdgcn_struct_buffer_load_lds})
2392 .Any({{_},
2393 {{}, {IntrId, SgprV4S32, SgprP3, Imm, Vgpr32, Vgpr32, Sgpr32}}});
2394
2395 addRulesForIOpcs({amdgcn_raw_ptr_buffer_load_lds})
2396 .Any({{_}, {{}, {IntrId, SgprP8, SgprP3, Imm, Vgpr32, Sgpr32}}});
2397
2398 addRulesForIOpcs({amdgcn_raw_ptr_buffer_load_async_lds})
2399 .Any({{}, {{}, {IntrId, SgprP8, SgprB32_M0, Imm, VgprB32, SgprB32}}});
2400
2401 addRulesForIOpcs({amdgcn_struct_ptr_buffer_load_async_lds})
2402 .Any({{_},
2403 {{}, {IntrId, SgprP8, SgprB32_M0, Imm, Vgpr32, Vgpr32, Sgpr32}}});
2404
2405 addRulesForIOpcs({amdgcn_struct_ptr_buffer_load_lds})
2406 .Any({{_}, {{}, {IntrId, SgprP8, SgprP3, Imm, Vgpr32, Vgpr32, Sgpr32}}});
2407
2408 addRulesForIOpcs(
2409 {amdgcn_global_load_lds, amdgcn_load_to_lds, amdgcn_load_async_to_lds})
2410 .Any({{}, {{}, {IntrId, VgprP1, SgprB32_M0}}});
2411
2412 addRulesForIOpcs({amdgcn_global_load_async_to_lds_b8,
2413 amdgcn_global_load_async_to_lds_b32,
2414 amdgcn_global_load_async_to_lds_b64,
2415 amdgcn_global_load_async_to_lds_b128,
2416 amdgcn_global_store_async_from_lds_b8,
2417 amdgcn_global_store_async_from_lds_b32,
2418 amdgcn_global_store_async_from_lds_b64,
2419 amdgcn_global_store_async_from_lds_b128})
2420 .Any({{}, {{}, {IntrId, VgprP1, VgprP3}}});
2421
2422 addRulesForIOpcs({amdgcn_global_load_async_lds})
2423 .Any({{}, {{}, {IntrId, VgprP1, SgprB32_M0}}});
2424
2425 addRulesForIOpcs({amdgcn_tensor_load_to_lds, amdgcn_tensor_store_from_lds})
2426 .Any({{},
2427 {{},
2431
2432 addRulesForIOpcs({amdgcn_cluster_load_b32})
2434 .Any({{DivB32, _, UniP1}, {{VgprB32}, {IntrId, SgprP1, Imm, SgprB32_M0}}})
2435 .Any(
2436 {{DivB32, _, DivP1}, {{VgprB32}, {IntrId, VgprP1, Imm, SgprB32_M0}}});
2437
2438 addRulesForIOpcs({amdgcn_cluster_load_b64})
2440 .Any({{DivB64, _, UniP1}, {{VgprB64}, {IntrId, SgprP1, Imm, SgprB32_M0}}})
2441 .Any(
2442 {{DivB64, _, DivP1}, {{VgprB64}, {IntrId, VgprP1, Imm, SgprB32_M0}}});
2443
2444 addRulesForIOpcs({amdgcn_cluster_load_b128})
2446 .Any({{DivB128, _, UniP1},
2447 {{VgprB128}, {IntrId, SgprP1, Imm, SgprB32_M0}}})
2448 .Any({{DivB128, _, DivP1},
2449 {{VgprB128}, {IntrId, VgprP1, Imm, SgprB32_M0}}});
2450
2451 addRulesForIOpcs({amdgcn_cluster_load_async_to_lds_b8,
2452 amdgcn_cluster_load_async_to_lds_b32,
2453 amdgcn_cluster_load_async_to_lds_b64,
2454 amdgcn_cluster_load_async_to_lds_b128})
2455 .Any({{}, {{}, {IntrId, VgprP1, VgprP3, Imm, Imm, SgprB32_M0}}});
2456
2457 addRulesForIOpcs({amdgcn_perm_pk16_b4_u4}, StandardB)
2458 .Uni(B64, {{UniInVgprB64}, {IntrId, Vgpr32, Vgpr32, VgprV2S32}})
2459 .Div(B64, {{VgprB64}, {IntrId, Vgpr32, Vgpr32, VgprV2S32}});
2460
2461 addRulesForIOpcs({amdgcn_perm_pk16_b6_u4}, StandardB)
2463 .Div(B96, {{VgprB96}, {IntrId, Vgpr32, VgprB64, VgprV2S32}});
2464
2465 addRulesForIOpcs({amdgcn_perm_pk16_b8_u4}, StandardB)
2467 .Div(B128, {{VgprB128}, {IntrId, VgprB64, VgprB64, VgprV2S32}});
2468
2469 addRulesForIOpcs({amdgcn_wwm, amdgcn_strict_wwm, amdgcn_wqm, amdgcn_softwqm,
2470 amdgcn_strict_wqm},
2471 StandardB)
2472 .Div(B32, {{VgprB32}, {IntrId, VgprB32}})
2473 .Uni(B32, {{SgprB32}, {IntrId, SgprB32}})
2474 .Div(B64, {{VgprB64}, {IntrId, VgprB64}})
2475 .Uni(B64, {{SgprB64}, {IntrId, SgprB64}})
2476 .Div(B96, {{VgprB96}, {IntrId, VgprB96}})
2477 .Uni(B96, {{SgprB96}, {IntrId, SgprB96}})
2478 .Div(B128, {{VgprB128}, {IntrId, VgprB128}})
2479 .Uni(B128, {{SgprB128}, {IntrId, SgprB128}})
2480 .Any({{UniB256}, {{SgprB256}, {IntrId, SgprB256}}})
2481 .Any({{DivB256}, {{VgprB256}, {IntrId, VgprB256}}})
2482 .Any({{UniB512}, {{SgprB512}, {IntrId, SgprB512}}})
2483 .Any({{DivB512}, {{VgprB512}, {IntrId, VgprB512}}});
2484
2485 addRulesForIOpcs({amdgcn_init_whole_wave}).Any({{DivS1}, {{Vcc}, {IntrId}}});
2486
2487 addRulesForIOpcs({amdgcn_kill, amdgcn_wqm_demote})
2488 .Any({{}, {{}, {IntrId, Vcc}}});
2489
2490 addRulesForIOpcs({amdgcn_set_inactive}, StandardB)
2491 .Div(B32, {{VgprB32}, {IntrId, VgprB32, VgprB32}});
2492
2493 addRulesForIOpcs({amdgcn_set_inactive_chain_arg}, Standard)
2494 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
2495
2496 addRulesForIOpcs({amdgcn_cvt_sr_bf16_f32, amdgcn_cvt_sr_f16_f32}, Standard)
2497 .Div(V2S16, {{VgprV2S16}, {IntrId, VgprV2S16, Vgpr32, Vgpr32}});
2498
2499 addRulesForIOpcs({amdgcn_ballot}, Standard)
2500 .Uni(S64, {{Sgpr64}, {IntrId, Vcc}})
2501 .Uni(S32, {{Sgpr32}, {IntrId, Vcc}});
2502
2503 addRulesForIOpcs({amdgcn_inverse_ballot})
2504 .Any({{DivS1, _, S32}, {{Vcc}, {IntrId, SgprB32_ReadFirstLane}}})
2505 .Any({{DivS1, _, S64}, {{Vcc}, {IntrId, SgprB64_ReadFirstLane}}});
2506
2507 addRulesForIOpcs({amdgcn_live_mask, amdgcn_ps_live})
2508 .Any({{DivS1}, {{Vcc}, {}}});
2509
2510 addRulesForIOpcs({amdgcn_mov_dpp, amdgcn_mov_dpp8}, StandardB)
2511 .Div(B32, {{VgprB32}, {IntrId, VgprB32}})
2512 .Div(B64, {{VgprB64}, {IntrId, VgprB64}});
2513
2514 addRulesForIOpcs({amdgcn_update_dpp}, StandardB)
2515 .Div(B32, {{VgprB32}, {IntrId, VgprB32, VgprB32}})
2516 .Div(B64, {{VgprB64}, {IntrId, VgprB64, VgprB64}});
2517
2518 addRulesForIOpcs({amdgcn_sin, amdgcn_cos, amdgcn_tanh}, Standard)
2519 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16}})
2520 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16}})
2521 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}})
2522 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}});
2523
2524 addRulesForIOpcs({amdgcn_trig_preop}, Standard)
2525 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr32}})
2526 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr32}});
2527
2528 addRulesForIOpcs({amdgcn_exp2})
2529 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2530 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2531 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2532 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2533 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2534 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2535 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST);
2536
2537 addRulesForIOpcs({amdgcn_rcp, amdgcn_sqrt})
2538 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2539 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2540 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2541 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2542 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2543 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2544 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST)
2545 .Any({{DivS64}, {{Vgpr64}, {IntrId, Vgpr64}}})
2546 .Any({{UniS64}, {{UniInVgprS64}, {IntrId, Vgpr64}}});
2547
2548 addRulesForIOpcs({amdgcn_log})
2549 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2550 .Any({{UniBF16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2551 .Any({{UniS16}, {{Sgpr16}, {IntrId, Sgpr16}}}, hasPST)
2552 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}}, !hasPST)
2553 .Any({{DivS32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2554 .Any({{UniS32}, {{Sgpr32}, {IntrId, Sgpr32}}}, hasPST)
2555 .Any({{UniS32}, {{UniInVgprS32}, {IntrId, Vgpr32}}}, !hasPST);
2556
2557 addRulesForIOpcs({amdgcn_ds_atomic_async_barrier_arrive_b64})
2558 .Any({{}, {{}, {IntrId, VgprP3}}});
2559
2560 addRulesForIOpcs({amdgcn_ds_atomic_barrier_arrive_rtn_b64}, Standard)
2561 .Div(S64, {{Vgpr64}, {IntrId, VgprP3, Vgpr64}});
2562
2563 addRulesForIOpcs({amdgcn_ds_add_gs_reg_rtn, amdgcn_ds_sub_gs_reg_rtn},
2564 Standard)
2565 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}})
2566 .Div(S64, {{Vgpr64}, {IntrId, Vgpr32}});
2567
2568 addRulesForIOpcs({amdgcn_ds_append, amdgcn_ds_consume}, Standard)
2569 .Uni(S32, {{UniInVgprS32}, {IntrId, SgprB32_M0}})
2570 .Div(S32, {{Vgpr32}, {IntrId, SgprB32_M0}});
2571
2572 addRulesForIOpcs(
2573 {amdgcn_ds_bvh_stack_rtn, amdgcn_ds_bvh_stack_push4_pop1_rtn}, Standard)
2574 .Div(S32, {{Vgpr32, Vgpr32}, {IntrId, Vgpr32, Vgpr32, VgprV4S32}});
2575
2576 addRulesForIOpcs({amdgcn_ds_bvh_stack_push8_pop1_rtn}, Standard)
2577 .Div(S32, {{Vgpr32, Vgpr32}, {IntrId, Vgpr32, Vgpr32, VgprV8S32}});
2578
2579 addRulesForIOpcs({amdgcn_ds_bvh_stack_push8_pop2_rtn}, Standard)
2580 .Div(S64, {{Vgpr64, Vgpr32}, {IntrId, Vgpr32, Vgpr32, VgprV8S32}});
2581
2582 addRulesForIOpcs({amdgcn_ds_gws_sema_p, amdgcn_ds_gws_sema_v,
2583 amdgcn_ds_gws_sema_release_all})
2584 .Any({{}, {{}, {IntrId, SgprB32_M0}}});
2585
2586 addRulesForIOpcs(
2587 {amdgcn_ds_gws_barrier, amdgcn_ds_gws_init, amdgcn_ds_gws_sema_br})
2588 .Any({{}, {{}, {IntrId, Vgpr32, SgprB32_M0}}});
2589
2590 addRulesForIOpcs({amdgcn_ds_ordered_add, amdgcn_ds_ordered_swap}, Standard)
2591 .Div(S32, {{Vgpr32}, {IntrId, SgprB32_M0, Vgpr32}});
2592
2593 addRulesForIOpcs({amdgcn_ds_swizzle}, Standard)
2594 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32}})
2595 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32}});
2596
2597 addRulesForIOpcs({amdgcn_permlane16_var, amdgcn_permlanex16_var}, Standard)
2598 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2599
2600 addRulesForIOpcs({amdgcn_permlane16_swap, amdgcn_permlane32_swap}, Standard)
2601 .Div(S32, {{Vgpr32, Vgpr32}, {IntrId, Vgpr32, Vgpr32}});
2602
2603 addRulesForIOpcs({amdgcn_permlane64}, StandardB)
2604 .Div(B32, {{VgprB32}, {IntrId, VgprB32}});
2605
2606 addRulesForIOpcs({amdgcn_ds_read_tr4_b64, amdgcn_ds_read_tr8_b64})
2607 .Any({{DivV2S32}, {{VgprV2S32}, {IntrId, VgprP3}}});
2608
2609 addRulesForIOpcs({amdgcn_ds_read_tr6_b96})
2610 .Any({{DivV3S32}, {{VgprV3S32}, {IntrId, VgprP3}}});
2611
2612 addRulesForIOpcs({amdgcn_ds_read_tr16_b64})
2613 .Any({{DivV4S16}, {{VgprV4S16}, {IntrId, VgprP3}}});
2614
2615 addRulesForIOpcs({amdgcn_interp_p1}, Standard)
2616 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Imm, Imm, SgprB32_M0}});
2617
2618 addRulesForIOpcs({amdgcn_interp_p1_f16}, Standard)
2619 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Imm, Imm, Imm, SgprB32_M0}});
2620
2621 addRulesForIOpcs({amdgcn_interp_p2}, Standard)
2622 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Imm, Imm, SgprB32_M0}});
2623
2624 addRulesForIOpcs({amdgcn_interp_p2_f16}, Standard)
2625 .Div(S16,
2627
2628 addRulesForIOpcs({amdgcn_interp_mov}, Standard)
2629 .Div(S32, {{Vgpr32}, {IntrId, Imm, Imm, Imm, SgprB32_M0}});
2630
2631 addRulesForIOpcs({amdgcn_interp_inreg_p10, amdgcn_interp_inreg_p2,
2632 amdgcn_interp_inreg_p10_f16, amdgcn_interp_p10_rtz_f16},
2633 Standard)
2634 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2635 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2636
2637 addRulesForIOpcs({amdgcn_interp_inreg_p2_f16, amdgcn_interp_p2_rtz_f16},
2638 Standard)
2639 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2640 .Div(S16, {{Vgpr16}, {IntrId, Vgpr32, Vgpr32, Vgpr32}});
2641
2642 addRulesForIOpcs({amdgcn_frexp_exp})
2643 .Any({{UniS16}, {{UniInVgprS16}, {IntrId, Vgpr16}}})
2644 .Any({{DivS16}, {{Vgpr16}, {IntrId, Vgpr16}}})
2645 .Any({{UniS32, _, S32}, {{UniInVgprS32}, {IntrId, Vgpr32}}})
2646 .Any({{DivS32, _, S32}, {{Vgpr32}, {IntrId, Vgpr32}}})
2647 .Any({{UniS32, _, S64}, {{UniInVgprS32}, {IntrId, Vgpr64}}})
2648 .Any({{DivS32, _, S64}, {{Vgpr32}, {IntrId, Vgpr64}}});
2649
2650 addRulesForIOpcs({amdgcn_div_fmas}, Standard)
2651 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vcc}})
2652 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32, Vcc}})
2653 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr64, Vgpr64, Vcc}})
2654 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr64, Vgpr64, Vcc}});
2655
2656 addRulesForIOpcs({amdgcn_div_fixup}, Standard)
2657 .Div(S16, {{Vgpr16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
2658 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr16, Vgpr16, Vgpr16}})
2659 .Div(S32, {{Vgpr32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2660 .Uni(S32, {{UniInVgprS32}, {IntrId, Vgpr32, Vgpr32, Vgpr32}})
2661 .Div(S64, {{Vgpr64}, {IntrId, Vgpr64, Vgpr64, Vgpr64}})
2662 .Uni(S64, {{UniInVgprS64}, {IntrId, Vgpr64, Vgpr64, Vgpr64}});
2663
2664 addRulesForIOpcs({amdgcn_div_scale}, Standard)
2665 .Div(S32, {{Vgpr32, Vcc}, {IntrId, Vgpr32, Vgpr32}})
2666 .Uni(S32, {{UniInVgprS32, UniInVcc}, {IntrId, Vgpr32, Vgpr32}})
2667 .Div(S64, {{Vgpr64, Vcc}, {IntrId, Vgpr64, Vgpr64}})
2668 .Uni(S64, {{UniInVgprS64, UniInVcc}, {IntrId, Vgpr64, Vgpr64}});
2669
2670 addRulesForIOpcs(
2671 {amdgcn_fdot2, amdgcn_fdot2_f32_bf16, amdgcn_sdot2, amdgcn_udot2},
2672 Standard)
2674 .Div(S32, {{Vgpr32}, {IntrId, VgprV2S16, VgprV2S16, Vgpr32}});
2675
2676 addRulesForIOpcs({amdgcn_fdot2_f16_f16, amdgcn_fdot2_bf16_bf16}, Standard)
2678 .Div(S16, {{Vgpr16}, {IntrId, VgprV2S16, VgprV2S16, Vgpr16}});
2679
2680 addRulesForIOpcs({amdgcn_sudot4, amdgcn_sudot8}, Standard)
2681 .Uni(S32, {{UniInVgprS32}, {IntrId, Imm, Vgpr32, Imm, Vgpr32, Vgpr32}})
2682 .Div(S32, {{Vgpr32}, {IntrId, Imm, Vgpr32, Imm, Vgpr32, Vgpr32}});
2683
2684 addRulesForIOpcs({amdgcn_s_alloc_vgpr})
2686
2687 addRulesForIOpcs({amdgcn_sat_pk4_i4_i8, amdgcn_sat_pk4_u4_u8}, Standard)
2688 .Uni(S16, {{UniInVgprS16}, {IntrId, Vgpr32}})
2689 .Div(S16, {{Vgpr16}, {IntrId, Vgpr32}});
2690
2691 bool HasGFX90AInsts = ST->hasGFX90AInsts();
2692
2693 // On gfx90a+ both AGPR-form and VGPR-form exists
2694 addRulesForIOpcs({amdgcn_mfma_f32_32x32x1f32, amdgcn_mfma_f32_16x16x1f32,
2695 amdgcn_mfma_f32_4x4x1f32, amdgcn_mfma_f32_32x32x2f32,
2696 amdgcn_mfma_f32_16x16x4f32, amdgcn_mfma_f32_32x32x4f16,
2697 amdgcn_mfma_f32_16x16x4f16, amdgcn_mfma_f32_4x4x4f16,
2698 amdgcn_mfma_f32_32x32x8f16, amdgcn_mfma_f32_16x16x16f16,
2699 amdgcn_mfma_i32_32x32x4i8, amdgcn_mfma_i32_16x16x4i8,
2700 amdgcn_mfma_i32_4x4x4i8, amdgcn_mfma_i32_32x32x8i8,
2701 amdgcn_mfma_i32_16x16x16i8, amdgcn_mfma_f32_32x32x2bf16,
2702 amdgcn_mfma_f32_16x16x2bf16, amdgcn_mfma_f32_4x4x2bf16,
2703 amdgcn_mfma_f32_32x32x4bf16, amdgcn_mfma_f32_16x16x8bf16})
2704 .Any({{DivAnyTy},
2706 !HasGFX90AInsts)
2707 .Any({{DivAnyTy},
2708 {{VgprOrAgprAnyTy},
2710 HasGFX90AInsts);
2711
2712 // gfx90a+ only MFMAs
2713 addRulesForIOpcs({
2714 amdgcn_mfma_f32_32x32x4bf16_1k,
2715 amdgcn_mfma_f32_16x16x4bf16_1k,
2716 amdgcn_mfma_f32_4x4x4bf16_1k,
2717 amdgcn_mfma_f32_32x32x8bf16_1k,
2718 amdgcn_mfma_f32_16x16x16bf16_1k,
2719 amdgcn_mfma_f64_16x16x4f64,
2720 amdgcn_mfma_f64_4x4x4f64,
2721 amdgcn_mfma_i32_16x16x32_i8,
2722 amdgcn_mfma_i32_32x32x16_i8,
2723 amdgcn_mfma_f32_16x16x8_xf32,
2724 amdgcn_mfma_f32_32x32x4_xf32,
2725 amdgcn_mfma_f32_16x16x32_bf8_bf8,
2726 amdgcn_mfma_f32_16x16x32_bf8_fp8,
2727 amdgcn_mfma_f32_16x16x32_fp8_bf8,
2728 amdgcn_mfma_f32_16x16x32_fp8_fp8,
2729 amdgcn_mfma_f32_32x32x16_bf8_bf8,
2730 amdgcn_mfma_f32_32x32x16_bf8_fp8,
2731 amdgcn_mfma_f32_32x32x16_fp8_bf8,
2732 amdgcn_mfma_f32_32x32x16_fp8_fp8,
2733 // gfx950
2734 amdgcn_mfma_f32_16x16x32_f16,
2735 amdgcn_mfma_f32_32x32x16_f16,
2736 amdgcn_mfma_i32_16x16x64_i8,
2737 amdgcn_mfma_i32_32x32x32_i8,
2738 amdgcn_mfma_f32_16x16x32_bf16,
2739 amdgcn_mfma_f32_32x32x16_bf16,
2740 })
2741 .Any({{DivAnyTy},
2742 {{VgprOrAgprAnyTy},
2744
2745 addRulesForIOpcs(
2746 {// gfx942+
2747 amdgcn_smfmac_f32_16x16x32_f16, amdgcn_smfmac_f32_32x32x16_f16,
2748 amdgcn_smfmac_f32_16x16x32_bf16, amdgcn_smfmac_f32_32x32x16_bf16,
2749 amdgcn_smfmac_i32_16x16x64_i8, amdgcn_smfmac_i32_32x32x32_i8,
2750 amdgcn_smfmac_f32_16x16x64_bf8_bf8, amdgcn_smfmac_f32_16x16x64_bf8_fp8,
2751 amdgcn_smfmac_f32_16x16x64_fp8_bf8, amdgcn_smfmac_f32_16x16x64_fp8_fp8,
2752 amdgcn_smfmac_f32_32x32x32_bf8_bf8, amdgcn_smfmac_f32_32x32x32_bf8_fp8,
2753 amdgcn_smfmac_f32_32x32x32_fp8_bf8, amdgcn_smfmac_f32_32x32x32_fp8_fp8,
2754 // gfx950+
2755 amdgcn_smfmac_f32_16x16x64_f16, amdgcn_smfmac_f32_32x32x32_f16,
2756 amdgcn_smfmac_f32_16x16x64_bf16, amdgcn_smfmac_f32_32x32x32_bf16,
2757 amdgcn_smfmac_i32_16x16x128_i8, amdgcn_smfmac_i32_32x32x64_i8,
2758 amdgcn_smfmac_f32_16x16x128_bf8_bf8, amdgcn_smfmac_f32_16x16x128_bf8_fp8,
2759 amdgcn_smfmac_f32_16x16x128_fp8_bf8, amdgcn_smfmac_f32_16x16x128_fp8_fp8,
2760 amdgcn_smfmac_f32_32x32x64_bf8_bf8, amdgcn_smfmac_f32_32x32x64_bf8_fp8,
2761 amdgcn_smfmac_f32_32x32x64_fp8_bf8, amdgcn_smfmac_f32_32x32x64_fp8_fp8})
2762 .Any({{DivAnyTy},
2763 {{VgprOrAgprAnyTy},
2765
2766 addRulesForIOpcs({amdgcn_mfma_scale_f32_32x32x64_f8f6f4,
2767 amdgcn_mfma_scale_f32_16x16x128_f8f6f4})
2768 .Any({{DivAnyTy},
2769 {{VgprOrAgprAnyTy},
2771 Vgpr32, Imm, Vgpr32}}});
2772
2773 // WMMA/SWMMAC intrinsics: all register operands map to VGPR.
2774 addRulesForIOpcs(
2775 {// WMMA GFX11+
2776 amdgcn_wmma_f32_16x16x16_f16, amdgcn_wmma_f32_16x16x16_bf16,
2777 amdgcn_wmma_f16_16x16x16_f16, amdgcn_wmma_bf16_16x16x16_bf16,
2778 amdgcn_wmma_f16_16x16x16_f16_tied, amdgcn_wmma_bf16_16x16x16_bf16_tied,
2779 amdgcn_wmma_i32_16x16x16_iu8, amdgcn_wmma_i32_16x16x16_iu4,
2780 // WMMA GFX12
2781 amdgcn_wmma_f32_16x16x16_fp8_fp8, amdgcn_wmma_f32_16x16x16_fp8_bf8,
2782 amdgcn_wmma_f32_16x16x16_bf8_fp8, amdgcn_wmma_f32_16x16x16_bf8_bf8,
2783 amdgcn_wmma_i32_16x16x32_iu4,
2784 // WMMA GFX1250
2785 amdgcn_wmma_f32_16x16x4_f32, amdgcn_wmma_f32_16x16x32_bf16,
2786 amdgcn_wmma_f32_16x16x32_f16, amdgcn_wmma_f16_16x16x32_f16,
2787 amdgcn_wmma_bf16_16x16x32_bf16, amdgcn_wmma_bf16f32_16x16x32_bf16,
2788 amdgcn_wmma_f32_16x16x64_fp8_fp8, amdgcn_wmma_f32_16x16x64_fp8_bf8,
2789 amdgcn_wmma_f32_16x16x64_bf8_fp8, amdgcn_wmma_f32_16x16x64_bf8_bf8,
2790 amdgcn_wmma_f16_16x16x64_fp8_fp8, amdgcn_wmma_f16_16x16x64_fp8_bf8,
2791 amdgcn_wmma_f16_16x16x64_bf8_fp8, amdgcn_wmma_f16_16x16x64_bf8_bf8,
2792 amdgcn_wmma_f16_16x16x128_fp8_fp8, amdgcn_wmma_f16_16x16x128_fp8_bf8,
2793 amdgcn_wmma_f16_16x16x128_bf8_fp8, amdgcn_wmma_f16_16x16x128_bf8_bf8,
2794 amdgcn_wmma_f32_16x16x128_fp8_fp8, amdgcn_wmma_f32_16x16x128_fp8_bf8,
2795 amdgcn_wmma_f32_16x16x128_bf8_fp8, amdgcn_wmma_f32_16x16x128_bf8_bf8,
2796 amdgcn_wmma_i32_16x16x64_iu8, amdgcn_wmma_f32_16x16x128_f8f6f4,
2797 amdgcn_wmma_scale_f32_16x16x128_f8f6f4,
2798 amdgcn_wmma_scale16_f32_16x16x128_f8f6f4, amdgcn_wmma_f32_32x16x128_f4,
2799 amdgcn_wmma_scale_f32_32x16x128_f4, amdgcn_wmma_scale16_f32_32x16x128_f4,
2800 // WMMA GFX1251
2801 amdgcn_wmma_f64_16x16x4_f64,
2802 // SWMMAC GFX12
2803 amdgcn_swmmac_f32_16x16x32_f16, amdgcn_swmmac_f32_16x16x32_bf16,
2804 amdgcn_swmmac_f16_16x16x32_f16, amdgcn_swmmac_bf16_16x16x32_bf16,
2805 amdgcn_swmmac_i32_16x16x32_iu8, amdgcn_swmmac_i32_16x16x32_iu4,
2806 amdgcn_swmmac_i32_16x16x64_iu4, amdgcn_swmmac_f32_16x16x32_fp8_fp8,
2807 amdgcn_swmmac_f32_16x16x32_fp8_bf8, amdgcn_swmmac_f32_16x16x32_bf8_fp8,
2808 amdgcn_swmmac_f32_16x16x32_bf8_bf8,
2809 // SWMMAC GFX1250
2810 amdgcn_swmmac_f32_16x16x64_f16, amdgcn_swmmac_f32_16x16x64_bf16,
2811 amdgcn_swmmac_f16_16x16x64_f16, amdgcn_swmmac_bf16_16x16x64_bf16,
2812 amdgcn_swmmac_bf16f32_16x16x64_bf16, amdgcn_swmmac_f32_16x16x128_fp8_fp8,
2813 amdgcn_swmmac_f32_16x16x128_fp8_bf8, amdgcn_swmmac_f32_16x16x128_bf8_fp8,
2814 amdgcn_swmmac_f32_16x16x128_bf8_bf8, amdgcn_swmmac_f16_16x16x128_fp8_fp8,
2815 amdgcn_swmmac_f16_16x16x128_fp8_bf8, amdgcn_swmmac_f16_16x16x128_bf8_fp8,
2816 amdgcn_swmmac_f16_16x16x128_bf8_bf8, amdgcn_swmmac_i32_16x16x128_iu8})
2817 .Any({{}, {{}, {}, ApplyAllVgpr}});
2818
2819} // end initialize rules
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
AMDGPU address space definition.
Contains the definition of a TargetInstrInfo class that is common to all AMD GPUs.
constexpr LLT S16
constexpr LLT S1
constexpr LLT V2S16
constexpr LLT S32
constexpr LLT V4S32
constexpr LLT V3S32
constexpr LLT S64
constexpr LLT V2S32
constexpr LLT S128
UniformityLLTOpPredicateID LLTToBId(LLT Ty)
bool matchUniformityAndLLT(Register Reg, UniformityLLTOpPredicateID UniID, const MachineUniformityInfo &MUI, const MachineRegisterInfo &MRI)
UniformityLLTOpPredicateID LLTToId(LLT Ty)
AMD GCN specific subclass of TargetSubtarget.
Declares convenience wrapper classes for interpreting MachineInstr instances as specific generic oper...
#define _
IRTranslator LLVM IR MI
Register Reg
Register const TargetRegisterInfo * TRI
Machine IR instance of the generic uniformity analysis.
bool operator()(const MachineInstr &MI) const
Predicate operator||(const Predicate &RHS) const
Predicate operator&&(const Predicate &RHS) const
Predicate(std::function< bool(const MachineInstr &)> Pred)
Predicate operator!() const
RegBankLegalizeRules(const GCNSubtarget &ST, MachineRegisterInfo &MRI)
const SetOfRulesForOpcode * getRulesForOpc(MachineInstr &MI) const
const RegBankLLTMapping * findMappingForMI(const MachineInstr &MI, const MachineRegisterInfo &MRI, const MachineUniformityInfo &MUI) const
void addFastRuleDivergent(UniformityLLTOpPredicateID Ty, RegBankLLTMapping RuleApplyIDs)
void addFastRuleUniform(UniformityLLTOpPredicateID Ty, RegBankLLTMapping RuleApplyIDs)
Predicate
This enumeration lists the possible predicates for CmpInst subclasses.
Definition InstrTypes.h:740
bool isSigned() const
Definition InstrTypes.h:993
bool isDivergentAtDef(ConstValueRefT V) const
Whether V is divergent at its definition.
bool isUniformAtDef(ConstValueRefT V) const
Whether V is uniform/non-divergent at its definition.
bool isEquality() const
Return true if this predicate is either EQ or NE.
static constexpr LLT scalar(unsigned SizeInBits)
Get a low-level scalar or aggregate "bag of bits".
bool isBFloat16() const
static constexpr LLT pointer(unsigned AddressSpace, unsigned SizeInBits)
Get a low-level pointer in the given address space.
constexpr TypeSize getSizeInBits() const
Returns the total size of the type. Must only be called on sized types.
static constexpr LLT fixed_vector(unsigned NumElements, unsigned ScalarSizeInBits)
Get a low-level fixed-width vector of some number of elements and element width.
TypeSize getValue() const
Representation of each machine instruction.
A description of a memory reference used in the backend.
LocationSize getSize() const
Return the size in bytes of the memory reference.
unsigned getAddrSpace() const
LLVM_ABI Align getAlign() const
Return the minimum known alignment in bytes of the actual memory reference.
MachineOperand class - Representation of each machine instruction operand.
bool isReg() const
isReg - Tests if this is a MO_Register operand.
Register getReg() const
getReg - Returns the register number.
MachineRegisterInfo - Keep track of information for virtual and physical registers,...
LLT getType(Register Reg) const
Get the low-level type of Reg or LLT{} if Reg is not a generic (target independent) virtual register.
const TargetRegisterInfo * getTargetRegisterInfo() const
Wrapper class representing virtual and physical registers.
Definition Register.h:20
This class consists of common code factored out of the SmallVector class to reduce code duplication b...
void append(ItTy in_start, ItTy in_end)
Add the specified range to the end of the SmallVector.
void swap(SmallVectorImpl &RHS)
void push_back(const T &Elt)
This is a 'vector' (really, a variable-sized array), optimized for the case when the array is small.
#define llvm_unreachable(msg)
Marks that the current location is not supposed to be reachable.
@ CONSTANT_ADDRESS_32BIT
Address space for 32-bit constant memory.
@ CONSTANT_ADDRESS
Address space for constant memory (VTX2).
bool isAnyPtr(LLT Ty, unsigned Width)
bool isUniformMMO(const MachineMemOperand *MMO)
This namespace contains an enum with a value for every intrinsic/builtin function known by LLVM.
This is an optimization pass for GlobalISel generic memory operations.
GenericUniformityInfo< MachineSSAContext > MachineUniformityInfo
static const MachineMemOperand::Flags MONoClobber
Mark the MMO of a uniform load if there are no potentially clobbering stores on any path from the sta...
Definition SIInstrInfo.h:46
decltype(auto) cast(const From &Val)
cast<X> - Return the argument parameter cast to the specified type.
Definition Casting.h:559
SmallVector< UniformityLLTOpPredicateID, 4 > OpUniformityAndTypes
PredicateMapping(std::initializer_list< UniformityLLTOpPredicateID > OpList, std::function< bool(const MachineInstr &)> TestFunc=nullptr)
bool match(const MachineInstr &MI, const MachineUniformityInfo &MUI, const MachineRegisterInfo &MRI) const
std::function< bool(const MachineInstr &)> TestFunc
RegBankLLTMapping(std::initializer_list< RegBankLLTMappingApplyID > DstOpMappingList, std::initializer_list< RegBankLLTMappingApplyID > SrcOpMappingList, LoweringMethodID LoweringMethod=DoNotLower)
SmallVector< RegBankLLTMappingApplyID, 2 > DstOpMapping
SmallVector< RegBankLLTMappingApplyID, 4 > SrcOpMapping
This struct is a compact representation of a valid (non-zero power of two) alignment.
Definition Alignment.h:39