28#define DEBUG_TYPE "gcn-hazard-recognizer"
31#define DEBUG_TYPE_VERBOSE "gcn-hazard-recognizer-verbose"
34 "Number of WMMA hazard V_NOPs hoisted from loops");
36 "Number of WMMA hazards where V_NOP hoisting was not possible");
40struct MFMAPaddingRatioParser :
public cl::parser<unsigned> {
43 bool parse(cl::Option &O, StringRef ArgName, StringRef Arg,
unsigned &
Value) {
45 return O.error(
"'" + Arg +
"' value invalid for uint argument!");
48 return O.error(
"'" + Arg +
"' value must be in the range [0, 100]!");
58 cl::desc(
"Fill a percentage of the latency between "
59 "neighboring MFMA with s_nops."));
64 cl::desc(
"Insert a s_nop x before every instruction"));
68 cl::desc(
"Hoist WMMA hazard V_NOPs from loops to preheaders"));
80 : Mode(Mode), CurrCycleInstr(nullptr), MF(MF),
81 ST(MF.getSubtarget<
GCNSubtarget>()), TII(*ST.getInstrInfo()),
82 TRI(TII.getRegisterInfo()), TSchedModel(TII.getSchedModel()), MLI(MLI),
83 ClauseUses(TRI.getNumRegUnits()), ClauseDefs(TRI.getNumRegUnits()) {
84 MaxLookAhead = MF.getRegInfo().isPhysRegUsed(AMDGPU::AGPR0) ? 19 : 5;
88 dbgs() <<
" PreRA hazard recognizer: " << MF.getName() <<
"\n";
100 if (CurrentCoExecStage.has_value()) {
101 unsigned Stage = *CurrentCoExecStage;
103 CoExecWindowLog[Stage] = ActiveCoExecInfo.Pattern[Stage];
104 dbgs() <<
" CoExec window ended at stage " << Stage <<
":\n";
111 EmittedInstrs.clear();
112 EmittedVALUInstrs.clear();
113 HasPendingWMMACoexecHazard =
false;
118void GCNHazardRecognizer::schedulerReset() {
120 if (CurrentCoExecStage.has_value() || CyclesUntilTRANS > 0 ||
122 dbgs() <<
" Scheduler Reset: clearing co-exec window, TRANS="
123 << CyclesUntilTRANS <<
", VALU=" << CyclesUntilVALU <<
"\n";
125 CurrentCoExecStage = std::nullopt;
126 CoExecWindowStartCycle = 0;
127 CyclesUntilTRANS = 0;
130 CoExecWindowLog.fill(
'.');
133void GCNHazardRecognizer::dumpCoExecWindow()
const {
134 unsigned W = ActiveCoExecInfo.TotalWindow;
139 dbgs() <<
" Stages: ";
140 for (
unsigned I = 0;
I <
W; ++
I)
141 dbgs() <<
I % 10 <<
' ';
145 dbgs() <<
" Slots: ";
146 for (
unsigned I = 0;
I <
W; ++
I)
147 dbgs() << ActiveCoExecInfo.Pattern[
I] <<
' ';
151 dbgs() <<
" Scheduled: ";
152 for (
unsigned I = 0;
I <
W; ++
I)
153 dbgs() << CoExecWindowLog[
I] <<
' ';
157void GCNHazardRecognizer::schedulerAdvanceCycle() {
159 if (CurrentCoExecStage.has_value()) {
160 unsigned Stage = *CurrentCoExecStage;
163 CoExecWindowLog[Stage] = ActiveCoExecInfo.Pattern[Stage];
165 CoExecWindowLog[Stage] =
'-';
170 bool HasState = CurrentCoExecStage.has_value() || CyclesUntilTRANS > 0 ||
173 dbgs() <<
" Scheduler AdvanceCycle:";
174 if (CurrentCoExecStage.has_value()) {
175 unsigned Stage = *CurrentCoExecStage;
176 unsigned Next = Stage + 1;
177 if (
Next >= ActiveCoExecInfo.TotalWindow)
178 dbgs() <<
" stage " << Stage <<
"->expired";
180 dbgs() <<
" stage " << Stage <<
"->" <<
Next;
182 if (CyclesUntilTRANS > 0)
183 dbgs() <<
" TRANS=" << CyclesUntilTRANS <<
"->"
184 << (CyclesUntilTRANS - 1);
185 if (CyclesUntilVALU > 0)
186 dbgs() <<
" VALU=" << CyclesUntilVALU <<
"->" << (CyclesUntilVALU - 1);
192 if (CyclesUntilTRANS > 0)
194 if (CyclesUntilVALU > 0)
198 if (CurrentCoExecStage.has_value()) {
199 unsigned Stage = *CurrentCoExecStage + 1;
200 if (Stage >= ActiveCoExecInfo.TotalWindow) {
203 dbgs() <<
" CoExec window complete:\n";
206 CurrentCoExecStage = std::nullopt;
208 CurrentCoExecStage = Stage;
213bool GCNHazardRecognizer::hasCoExecWindowModel()
const {
219 if (ST.hasWMMACoexecutionHazards() && ST.hasTransCoexecutionHazard() &&
223 if (ST.hasGFX950Insts() &&
230void GCNHazardRecognizer::updateWMMAWindowState(
const MachineInstr &
MI) {
231 if (!hasCoExecWindowModel())
241 if (CurrentCoExecStage.has_value()) {
242 unsigned Stage = *CurrentCoExecStage;
244 CoExecWindowLog[Stage] = ActiveCoExecInfo.Pattern[Stage];
245 dbgs() <<
" CoExec window interrupted at stage " << Stage <<
":\n";
252 CurrentCoExecStage = 0;
253 CoExecWindowLog.fill(
'.');
255 LLVM_DEBUG(
dbgs() <<
" WMMA window started: " << ActiveCoExecInfo.Pattern
256 <<
" (window=" << ActiveCoExecInfo.TotalWindow <<
")\n"
260void GCNHazardRecognizer::updateTRANSState(
const MachineInstr &
MI) {
261 if (!hasCoExecWindowModel())
275 CyclesUntilTRANS = 2;
279void GCNHazardRecognizer::updateMultiCycleVALUState(
const MachineInstr &
MI) {
280 if (!hasCoExecWindowModel())
291 unsigned RepeatRate = TII.getRepeatRate(
MI);
292 if (RepeatRate > 1) {
296 CyclesUntilVALU = RepeatRate;
298 <<
", CyclesUntilVALU=" << CyclesUntilVALU <<
"\n");
308unsigned GCNHazardRecognizer::checkTRANSHazard(
const MachineInstr &
MI)
const {
309 if (!CyclesUntilTRANS)
314 return CyclesUntilTRANS;
318 TII.getRepeatRate(
MI) > 1)
319 return CyclesUntilTRANS;
325GCNHazardRecognizer::checkMultiCycleVALUHazard(
const MachineInstr &
MI)
const {
326 if (!CyclesUntilVALU)
337 return CyclesUntilVALU;
341GCNHazardRecognizer::checkWMMACoexecSlot(
const MachineInstr &
MI)
const {
343 if (!CurrentCoExecStage.has_value())
346 unsigned Stage = *CurrentCoExecStage;
349 if (ActiveCoExecInfo.canCoExec(InstMask, Stage))
353 auto NextStage = ActiveCoExecInfo.findNextAllowedStage(InstMask, Stage);
354 if (NextStage.has_value()) {
355 unsigned StallCycles = *NextStage - Stage;
358 dbgs() <<
" CoExec stall: stage=" << Stage <<
"("
361 <<
" -> stall " << StallCycles <<
" (next allowed=" << *NextStage
368 unsigned StallCycles = ActiveCoExecInfo.TotalWindow - Stage;
371 dbgs() <<
" CoExec stall: stage=" << Stage <<
"("
374 << StallCycles <<
" (window ends)\n"
380GCNHazardRecognizer::checkMultiShadowHazard(
const MachineInstr &
MI)
const {
382 if (!hasCoExecWindowModel())
386 if (!CurrentCoExecStage.has_value())
389 if (!CyclesUntilTRANS)
399 unsigned LookAheadStage = *CurrentCoExecStage + CyclesUntilTRANS;
402 if (ActiveCoExecInfo.canCoExec(InstMask, LookAheadStage))
403 return CyclesUntilTRANS;
407 ActiveCoExecInfo.findNextAllowedStage(InstMask, LookAheadStage);
408 if (NextStage.has_value()) {
409 unsigned StallCycles = *NextStage - *CurrentCoExecStage;
414 unsigned StallCycles = ActiveCoExecInfo.TotalWindow - *CurrentCoExecStage;
418void GCNHazardRecognizer::schedulerEmitInstruction(
MachineInstr *
MI) {
420 bool InWindow = CurrentCoExecStage.has_value();
421 bool HasActiveState =
422 InWindow || CyclesUntilTRANS > 0 || CyclesUntilVALU > 0;
423 if (HasActiveState) {
425 unsigned Stage = *CurrentCoExecStage;
426 dbgs() <<
" Stage " << Stage <<
"("
439 bool HasActiveState = CurrentCoExecStage.has_value() ||
440 CyclesUntilTRANS > 0 || CyclesUntilVALU > 0;
446 updateWMMAWindowState(*
MI);
447 updateTRANSState(*
MI);
448 updateMultiCycleVALUState(*
MI);
458 schedulerEmitInstruction(
MI);
462 return Opcode == AMDGPU::V_DIV_FMAS_F32_e64 || Opcode == AMDGPU::V_DIV_FMAS_F64_e64;
466 return Opcode == AMDGPU::S_GETREG_B32 || Opcode == AMDGPU::S_GETREG_B32_const;
471 case AMDGPU::S_SETREG_B32:
472 case AMDGPU::S_SETREG_B32_mode:
473 case AMDGPU::S_SETREG_IMM32_B32:
474 case AMDGPU::S_SETREG_IMM32_B32_mode:
481 return Opcode == AMDGPU::V_READLANE_B32 || Opcode == AMDGPU::V_WRITELANE_B32;
485 return Opcode == AMDGPU::S_RFE_B64;
490 case AMDGPU::S_MOVRELS_B32:
491 case AMDGPU::S_MOVRELS_B64:
492 case AMDGPU::S_MOVRELD_B32:
493 case AMDGPU::S_MOVRELD_B64:
502 if (
TII.isAlwaysGDS(
MI.getOpcode()))
505 switch (
MI.getOpcode()) {
506 case AMDGPU::S_SENDMSG:
507 case AMDGPU::S_SENDMSGHALT:
508 case AMDGPU::S_TTRACEDATA:
512 case AMDGPU::DS_PERMUTE_B32:
513 case AMDGPU::DS_BPERMUTE_B32:
516 if (
TII.isDS(
MI.getOpcode())) {
517 int GDS = AMDGPU::getNamedOperandIdx(
MI.getOpcode(),
518 AMDGPU::OpName::gds);
519 if (
MI.getOperand(GDS).getImm())
527 unsigned Opcode =
MI.getOpcode();
528 return Opcode == AMDGPU::V_PERMLANE16_B32_e64 ||
529 Opcode == AMDGPU::V_PERMLANE64_B32 ||
530 Opcode == AMDGPU::V_PERMLANEX16_B32_e64 ||
531 Opcode == AMDGPU::V_PERMLANE16_VAR_B32_e64 ||
532 Opcode == AMDGPU::V_PERMLANEX16_VAR_B32_e64 ||
533 Opcode == AMDGPU::V_PERMLANE16_SWAP_B32_e32 ||
534 Opcode == AMDGPU::V_PERMLANE16_SWAP_B32_e64 ||
535 Opcode == AMDGPU::V_PERMLANE32_SWAP_B32_e32 ||
536 Opcode == AMDGPU::V_PERMLANE32_SWAP_B32_e64 ||
537 Opcode == AMDGPU::V_PERMLANE_BCAST_B32_e64 ||
538 Opcode == AMDGPU::V_PERMLANE_UP_B32_e64 ||
539 Opcode == AMDGPU::V_PERMLANE_DOWN_B32_e64 ||
540 Opcode == AMDGPU::V_PERMLANE_XOR_B32_e64 ||
541 Opcode == AMDGPU::V_PERMLANE_IDX_GEN_B32_e64;
551 AMDGPU::OpName::simm16);
567 if (checkMultiShadowHazard(*
MI) > 0)
569 if (checkWMMACoexecSlot(*
MI) > 0)
571 if (checkTRANSHazard(*
MI) > 0)
573 if (checkMultiCycleVALUHazard(*
MI) > 0)
583 if (ST.hasNSAtoVMEMBug() && checkNSAtoVMEMHazard(
MI) > 0)
586 if (checkFPAtomicToDenormModeHazard(
MI) > 0)
591 if (checkWMMACoexecutionHazards(
MI) > 0) {
592 HasPendingWMMACoexecHazard =
true;
597 if (ST.hasNoDataDepHazard())
604 checkVALUHazards(
MI) > 0)
610 if (
isDivFMas(
MI->getOpcode()) && checkDivFMasHazards(
MI) > 0)
613 if (
isRWLane(
MI->getOpcode()) && checkRWLaneHazards(
MI) > 0)
619 checkMAIVALUHazards(
MI) > 0)
622 if (
isSGetReg(
MI->getOpcode()) && checkGetRegHazards(
MI) > 0)
625 if (
isSSetReg(
MI->getOpcode()) && checkSetRegHazards(
MI) > 0)
628 if (
isRFE(
MI->getOpcode()) && checkRFEHazards(
MI) > 0)
631 if (((ST.hasReadM0MovRelInterpHazard() &&
633 MI->getOpcode() == AMDGPU::DS_WRITE_ADDTID_B32 ||
634 MI->getOpcode() == AMDGPU::DS_READ_ADDTID_B32)) ||
636 (ST.hasReadM0LdsDmaHazard() &&
isLdsDma(*
MI)) ||
637 (ST.hasReadM0LdsDirectHazard() &&
638 MI->readsRegister(AMDGPU::LDS_DIRECT,
nullptr))) &&
639 checkReadM0Hazards(
MI) > 0)
646 checkMAILdStHazards(
MI) > 0)
649 if (
MI->isInlineAsm() && checkInlineAsmHazards(
MI) > 0)
657 while (Quantity > 0) {
658 unsigned Arg = std::min(Quantity, 8u);
666GCNHazardRecognizer::getMFMAPipelineWaitStates(
const MachineInstr &
MI)
const {
667 const MCSchedClassDesc *SC = TSchedModel.resolveSchedClass(&
MI);
668 assert(TSchedModel.getWriteProcResBegin(SC) !=
669 TSchedModel.getWriteProcResEnd(SC));
670 return TSchedModel.getWriteProcResBegin(SC)->ReleaseAtCycle;
673void GCNHazardRecognizer::processBundle() {
677 for (;
MI !=
E &&
MI->isInsideBundle(); ++
MI) {
678 CurrCycleInstr = &*
MI;
682 fixHazards(CurrCycleInstr);
690 for (
unsigned i = 0, e = std::min(WaitStates,
MaxLookAhead - 1); i <
e; ++i)
691 EmittedInstrs.push_front(
nullptr);
693 EmittedInstrs.push_front(CurrCycleInstr);
696 CurrCycleInstr =
nullptr;
704 if (
MI->isInsideBundle())
718 CurrCycleInstr =
nullptr;
727 W = checkWMMACoexecSlot(*
MI);
728 W = std::max(W, checkTRANSHazard(*
MI));
729 W = std::max(W, checkMultiCycleVALUHazard(*
MI));
730 W = std::max(W, checkMultiShadowHazard(*
MI));
746 return std::max(WaitStates, checkSMRDHazards(
MI));
748 if (ST.hasNSAtoVMEMBug())
749 WaitStates = std::max(WaitStates, checkNSAtoVMEMHazard(
MI));
751 WaitStates = std::max(WaitStates, checkFPAtomicToDenormModeHazard(
MI));
753 if (ST.hasNoDataDepHazard())
757 WaitStates = std::max(WaitStates, checkVMEMHazards(
MI));
760 WaitStates = std::max(WaitStates, checkVALUHazards(
MI));
763 WaitStates = std::max(WaitStates, checkDPPHazards(
MI));
766 WaitStates = std::max(WaitStates, checkDivFMasHazards(
MI));
769 WaitStates = std::max(WaitStates, checkRWLaneHazards(
MI));
774 checkMAIVALUHazards(
MI) > 0)
775 WaitStates = std::max(WaitStates, checkMAIVALUHazards(
MI));
777 if (
MI->isInlineAsm())
778 return std::max(WaitStates, checkInlineAsmHazards(
MI));
781 return std::max(WaitStates, checkGetRegHazards(
MI));
784 return std::max(WaitStates, checkSetRegHazards(
MI));
787 return std::max(WaitStates, checkRFEHazards(
MI));
789 if ((ST.hasReadM0MovRelInterpHazard() &&
791 MI->getOpcode() == AMDGPU::DS_WRITE_ADDTID_B32 ||
792 MI->getOpcode() == AMDGPU::DS_READ_ADDTID_B32)) ||
794 (ST.hasReadM0LdsDmaHazard() &&
isLdsDma(*
MI)) ||
795 (ST.hasReadM0LdsDirectHazard() &&
796 MI->readsRegister(AMDGPU::LDS_DIRECT,
nullptr)))
797 return std::max(WaitStates, checkReadM0Hazards(
MI));
800 return std::max(WaitStates, checkMAIHazards(
MI));
803 return std::max(WaitStates, checkMAILdStHazards(
MI));
806 return std::max(WaitStates, checkPermlaneHazards(
MI));
812 EmittedInstrs.push_front(
nullptr);
817 schedulerAdvanceCycle();
821 if (!CurrCycleInstr) {
822 EmittedInstrs.push_front(
nullptr);
824 if (HasPendingWMMACoexecHazard)
825 EmittedVALUInstrs.push_front(
nullptr);
829 HasPendingWMMACoexecHazard =
false;
831 if (CurrCycleInstr->isBundle()) {
836 unsigned NumWaitStates = TII.getNumWaitStates(*CurrCycleInstr);
837 if (!NumWaitStates) {
838 CurrCycleInstr =
nullptr;
843 EmittedInstrs.push_front(CurrCycleInstr);
850 EmittedVALUInstrs.push_front(CurrCycleInstr);
856 while (!EmittedVALUInstrs.empty() && EmittedVALUInstrs.front() ==
nullptr)
857 EmittedVALUInstrs.pop_front();
865 EmittedInstrs.push_front(
nullptr);
872 if (EmittedVALUInstrs.size() > MaxVALULookAhead)
873 EmittedVALUInstrs.resize(MaxVALULookAhead);
875 CurrCycleInstr =
nullptr;
880 "Bottom-up scheduling shouldn't run in hazard recognizer mode");
890template <
typename StateT>
900 static bool isEqual(
const StateMapKey &
LHS,
const StateMapKey &
RHS) {
905 static unsigned getHashValue(
const StateMapKey &
Key) {
906 return StateT::getHashValue((*
Key.States)[
Key.Idx]);
908 static unsigned getHashValue(
const StateT &State) {
909 return StateT::getHashValue(State);
911 static bool isEqual(
const StateMapKey &
LHS,
const StateMapKey &
RHS) {
912 return StateT::isEqual((*
LHS.States)[
LHS.Idx], (*
RHS.States)[
RHS.Idx]);
914 static bool isEqual(
const StateT &
LHS,
const StateMapKey &
RHS) {
915 return StateT::isEqual(
LHS, (*
RHS.States)[
RHS.Idx]);
924 StateT State = InitialState;
927 unsigned WorkIdx = 0;
929 bool Expired =
false;
930 for (
auto E =
MBB->instr_rend();
I !=
E; ++
I) {
935 auto Result = IsHazard(State, *
I);
943 if (
I->isInlineAsm() ||
I->isMetaInstruction())
946 UpdateState(State, *
I);
950 unsigned StateIdx = States.
size();
951 StateMapKey
Key = {&States, StateIdx};
952 auto Insertion = StateMap.
insert_as(std::pair(
Key, StateIdx), State);
953 if (Insertion.second) {
956 StateIdx = Insertion.first->second;
959 Worklist.
insert(std::pair(Pred, StateIdx));
962 if (WorkIdx == Worklist.
size())
966 std::tie(
MBB, StateIdx) = Worklist[WorkIdx++];
967 State = States[StateIdx];
968 I =
MBB->instr_rbegin();
985 for (
auto E =
MBB->instr_rend();
I !=
E; ++
I) {
993 if (
I->isInlineAsm())
996 WaitStates += GetNumWaitStates(*
I);
998 if (IsExpired(*
I, WaitStates))
999 return std::numeric_limits<int>::max();
1002 int MinWaitStates = std::numeric_limits<int>::max();
1004 if (!Visited.
insert(Pred).second)
1008 IsExpired, Visited, GetNumWaitStates);
1010 MinWaitStates = std::min(MinWaitStates, W);
1013 return MinWaitStates;
1024 std::next(
MI->getReverseIterator()), 0, IsExpired,
1025 Visited, GetNumWaitStates);
1028int GCNHazardRecognizer::getWaitStatesSince(
1029 IsHazardFn IsHazard,
int Limit, GetNumWaitStatesFn GetNumWaitStates)
const {
1031 auto IsExpiredFn = [Limit](
const MachineInstr &,
int WaitStates) {
1032 return WaitStates >= Limit;
1034 return ::getWaitStatesSince(IsHazard, CurrCycleInstr,
IsExpiredFn,
1039 for (MachineInstr *
MI : EmittedInstrs) {
1044 if (
MI->isInlineAsm())
1047 WaitStates +=
MI ? GetNumWaitStates(*
MI) : 1;
1049 if (WaitStates >= Limit)
1052 return std::numeric_limits<int>::max();
1055int GCNHazardRecognizer::getWaitStatesSince(IsHazardFn IsHazard,
1060int GCNHazardRecognizer::getWaitStatesSinceVALU(IsHazardFn IsHazard,
1063 auto GetVALUWaitStates = [](
const MachineInstr &
MI) ->
unsigned {
1066 return getWaitStatesSince(IsHazard, Limit, GetVALUWaitStates);
1072 assert(Limit <= (
int)MaxVALULookAhead &&
1073 "Limit exceeds the EmittedVALUInstrs lookahead window");
1075 for (MachineInstr *
MI : EmittedVALUInstrs) {
1083 if (WaitStates >= Limit)
1086 return std::numeric_limits<int>::max();
1089int GCNHazardRecognizer::getWaitStatesSinceDef(
unsigned Reg,
1090 IsHazardFn IsHazardDef,
1092 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1095 return IsHazardDef(
MI) &&
MI.modifiesRegister(
Reg, TRI);
1098 return getWaitStatesSince(
IsHazardFn, Limit);
1101int GCNHazardRecognizer::getWaitStatesSinceSetReg(IsHazardFn IsHazard,
1107 return getWaitStatesSince(
IsHazardFn, Limit);
1116 for (MCRegUnit Unit :
TRI.regunits(
Reg))
1117 BV.
set(
static_cast<unsigned>(Unit));
1129void GCNHazardRecognizer::addClauseInst(
const MachineInstr &
MI)
const {
1141int GCNHazardRecognizer::checkSoftClauseHazards(
MachineInstr *MEM)
const {
1144 if (!ST.isXNACKEnabled())
1147 bool IsSMRD = TII.isSMRD(*MEM);
1161 for (MachineInstr *
MI : EmittedInstrs) {
1173 if (ClauseDefs.none())
1179 if (
MEM->mayStore())
1182 addClauseInst(*MEM);
1186 return ClauseDefs.anyCommon(ClauseUses) ? 1 : 0;
1189int GCNHazardRecognizer::checkSMRDHazards(
MachineInstr *SMRD)
const {
1190 int WaitStatesNeeded = 0;
1192 WaitStatesNeeded = checkSoftClauseHazards(SMRD);
1195 if (!ST.hasSMRDReadVALUDefHazard())
1196 return WaitStatesNeeded;
1200 int SmrdSgprWaitStates = 4;
1201 auto IsHazardDefFn = [
this](
const MachineInstr &
MI) {
1202 return TII.isVALU(
MI,
true);
1204 auto IsBufferHazardDefFn = [
this](
const MachineInstr &
MI) {
1205 return TII.isSALU(
MI);
1208 bool IsBufferSMRD = TII.isBufferSMRD(*SMRD);
1210 for (
const MachineOperand &Use :
SMRD->uses()) {
1213 int WaitStatesNeededForUse =
1214 SmrdSgprWaitStates - getWaitStatesSinceDef(
Use.getReg(), IsHazardDefFn,
1215 SmrdSgprWaitStates);
1216 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
1226 int WaitStatesNeededForUse =
1227 SmrdSgprWaitStates - getWaitStatesSinceDef(
Use.getReg(),
1228 IsBufferHazardDefFn,
1229 SmrdSgprWaitStates);
1230 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
1234 return WaitStatesNeeded;
1237int GCNHazardRecognizer::checkVMEMHazards(
MachineInstr *VMEM)
const {
1238 if (!ST.hasVMEMReadSGPRVALUDefHazard())
1241 int WaitStatesNeeded = checkSoftClauseHazards(VMEM);
1245 const int VmemSgprWaitStates = 5;
1246 auto IsHazardDefFn = [
this](
const MachineInstr &
MI) {
1247 return TII.isVALU(
MI,
true);
1249 for (
const MachineOperand &Use :
VMEM->uses()) {
1250 if (!
Use.isReg() || TRI.isVectorRegister(MF.getRegInfo(),
Use.getReg()))
1253 int WaitStatesNeededForUse =
1254 VmemSgprWaitStates - getWaitStatesSinceDef(
Use.getReg(), IsHazardDefFn,
1255 VmemSgprWaitStates);
1256 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
1258 return WaitStatesNeeded;
1262 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1263 const SIInstrInfo *TII = ST.getInstrInfo();
1266 int DppVgprWaitStates = 2;
1267 int DppExecWaitStates = 5;
1268 int WaitStatesNeeded = 0;
1269 auto IsHazardDefFn = [TII](
const MachineInstr &
MI) {
1270 return TII->isVALU(
MI,
true);
1273 for (
const MachineOperand &Use :
DPP->uses()) {
1274 if (!
Use.isReg() || !TRI->isVGPR(MF.getRegInfo(),
Use.getReg()))
1276 int WaitStatesNeededForUse =
1277 DppVgprWaitStates - getWaitStatesSinceDef(
1279 [](
const MachineInstr &) { return true; },
1281 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
1284 WaitStatesNeeded = std::max(
1286 DppExecWaitStates - getWaitStatesSinceDef(AMDGPU::EXEC, IsHazardDefFn,
1287 DppExecWaitStates));
1289 return WaitStatesNeeded;
1292int GCNHazardRecognizer::checkDivFMasHazards(
MachineInstr *DivFMas)
const {
1293 const SIInstrInfo *TII = ST.getInstrInfo();
1297 const int DivFMasWaitStates = 4;
1298 auto IsHazardDefFn = [TII](
const MachineInstr &
MI) {
1299 return TII->isVALU(
MI,
true);
1301 int WaitStatesNeeded = getWaitStatesSinceDef(AMDGPU::VCC, IsHazardDefFn,
1304 return DivFMasWaitStates - WaitStatesNeeded;
1307int GCNHazardRecognizer::checkGetRegHazards(
MachineInstr *GetRegInstr)
const {
1308 const SIInstrInfo *TII = ST.getInstrInfo();
1309 unsigned GetRegHWReg =
getHWReg(TII, *GetRegInstr);
1311 const int GetRegWaitStates = 2;
1312 auto IsHazardFn = [TII, GetRegHWReg](
const MachineInstr &
MI) {
1315 int WaitStatesNeeded = getWaitStatesSinceSetReg(
IsHazardFn, GetRegWaitStates);
1317 return GetRegWaitStates - WaitStatesNeeded;
1320int GCNHazardRecognizer::checkSetRegHazards(
MachineInstr *SetRegInstr)
const {
1321 const SIInstrInfo *TII = ST.getInstrInfo();
1322 unsigned HWReg =
getHWReg(TII, *SetRegInstr);
1324 const int SetRegWaitStates = ST.getSetRegWaitStates();
1325 auto IsHazardFn = [TII, HWReg](
const MachineInstr &
MI) {
1328 int WaitStatesNeeded = getWaitStatesSinceSetReg(
IsHazardFn, SetRegWaitStates);
1329 return SetRegWaitStates - WaitStatesNeeded;
1332int GCNHazardRecognizer::createsVALUHazard(
const MachineInstr &
MI)
const {
1336 const SIInstrInfo *TII = ST.getInstrInfo();
1337 unsigned Opcode =
MI.getOpcode();
1338 const MCInstrDesc &
Desc =
MI.getDesc();
1340 int VDataIdx = AMDGPU::getNamedOperandIdx(Opcode, AMDGPU::OpName::vdata);
1343 VDataRCID = TII->getOpRegClassID(
Desc.operands()[VDataIdx]);
1345 if (TII->isMUBUF(
MI) || TII->isMTBUF(
MI)) {
1355 if (ST.hasVDecCoExecHazard())
1357 const MachineOperand *SOffset =
1358 TII->getNamedOperand(
MI, AMDGPU::OpName::soffset);
1359 if (!SOffset || !SOffset->
isReg())
1368 if (TII->isMIMG(
MI)) {
1369 int SRsrcIdx = AMDGPU::getNamedOperandIdx(Opcode, AMDGPU::OpName::srsrc);
1371 Desc.operands()[SRsrcIdx])) == 256);
1375 if (TII->isFLAT(
MI)) {
1387int GCNHazardRecognizer::checkUniformWindowVALUHazardsHelper(
1392 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1394 auto IsHazard = [&](
const MachineInstr &
MI) {
1395 int DataIdx = createsVALUHazard(
MI);
1396 return DataIdx >= 0 &&
1397 TRI->regsOverlap(
MI.getOperand(DataIdx).getReg(),
Reg);
1400 return std::max(0, 1 - getWaitStatesSince(IsHazard, 1));
1403int GCNHazardRecognizer::checkSOFFSETWindowVALUHazardsHelper(
1410 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1411 const SIInstrInfo *TII = ST.getInstrInfo();
1413 int WaitStatesNeeded = 0;
1417 for (
int Window = 1; Window <= 2; ++Window) {
1418 auto IsHazard = [&](
const MachineInstr &
MI) {
1419 int DataIdx = createsVALUHazard(
MI);
1421 !TRI->regsOverlap(
MI.getOperand(DataIdx).getReg(),
Reg))
1426 if (Window == 1 || !TII->isBUF(
MI))
1429 const MachineOperand *SOffset =
1430 TII->getNamedOperand(
MI, AMDGPU::OpName::soffset);
1431 return !SOffset || !SOffset->
isReg();
1433 WaitStatesNeeded = std::max(WaitStatesNeeded,
1434 Window - getWaitStatesSince(IsHazard, Window));
1437 return WaitStatesNeeded;
1440int GCNHazardRecognizer::checkVALUHazardsHelper(
1445 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1447 if (!TRI->isVectorRegister(MRI,
Def.getReg()))
1450 if (ST.hasVDecCoExecHazard())
1451 return checkSOFFSETWindowVALUHazardsHelper(
Def.getReg());
1453 return checkUniformWindowVALUHazardsHelper(
Def.getReg());
1469 unsigned Opcode =
MI.getOpcode();
1479 if (
auto *DstSel =
TII->getNamedOperand(
MI, AMDGPU::OpName::dst_sel))
1481 return TII->getNamedOperand(
MI, AMDGPU::OpName::vdst);
1487 if (
TII->getNamedImmOperand(
MI, AMDGPU::OpName::src0_modifiers) &
1489 return TII->getNamedOperand(
MI, AMDGPU::OpName::vdst);
1493 (
TII->getNamedImmOperand(
MI, AMDGPU::OpName::src2_modifiers) &
1495 return TII->getNamedOperand(
MI, AMDGPU::OpName::vdst);
1501 return TII->getNamedOperand(
MI, AMDGPU::OpName::vdst);
1522 for (
auto &Operand : VALU->operands()) {
1523 if (Operand.isReg() &&
TRI->regsOverlap(Dst->getReg(), Operand.getReg())) {
1530int GCNHazardRecognizer::checkVALUHazards(
MachineInstr *VALU)
const {
1531 int WaitStatesNeeded = 0;
1534 const int TransDefWaitstates = 1;
1536 auto IsTransDefFn = [
this,
VALU](
const MachineInstr &
MI) {
1539 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1540 const SIInstrInfo *TII = ST.getInstrInfo();
1541 Register Def = TII->getNamedOperand(
MI, AMDGPU::OpName::vdst)->getReg();
1543 for (
const MachineOperand &Use :
VALU->explicit_uses()) {
1544 if (
Use.isReg() && TRI->regsOverlap(Def,
Use.getReg()))
1551 int WaitStatesNeededForDef =
1552 TransDefWaitstates -
1553 getWaitStatesSince(IsTransDefFn, TransDefWaitstates);
1554 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForDef);
1557 if (ST.hasDstSelForwardingHazard() || ST.hasCvtScaleForwardingHazard()) {
1558 const int Shift16DefWaitstates = 1;
1560 auto IsShift16BitDefFn = [
this,
VALU](
const MachineInstr &ProducerMI) {
1561 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1562 const MachineOperand *ForwardedDst =
1568 if (ProducerMI.isInlineAsm()) {
1570 for (
auto &Def : ProducerMI.all_defs()) {
1579 int WaitStatesNeededForDef =
1580 Shift16DefWaitstates -
1581 getWaitStatesSince(IsShift16BitDefFn, Shift16DefWaitstates);
1582 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForDef);
1585 if (ST.hasVDecCoExecHazard()) {
1586 const int VALUWriteSGPRVALUReadWaitstates = 2;
1587 const int VALUWriteEXECRWLane = 4;
1588 const int VALUWriteVGPRReadlaneRead = 1;
1590 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1591 const MachineRegisterInfo &MRI = MF.getRegInfo();
1593 auto IsVALUDefSGPRFn = [&
UseReg, TRI](
const MachineInstr &
MI) {
1596 return MI.modifiesRegister(
UseReg, TRI);
1599 for (
const MachineOperand &Use :
VALU->explicit_uses()) {
1604 if (TRI->isSGPRReg(MRI,
UseReg)) {
1605 int WaitStatesNeededForDef =
1606 VALUWriteSGPRVALUReadWaitstates -
1607 getWaitStatesSince(IsVALUDefSGPRFn,
1608 VALUWriteSGPRVALUReadWaitstates);
1609 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForDef);
1613 if (
VALU->readsRegister(AMDGPU::VCC, TRI)) {
1615 int WaitStatesNeededForDef =
1616 VALUWriteSGPRVALUReadWaitstates -
1617 getWaitStatesSince(IsVALUDefSGPRFn, VALUWriteSGPRVALUReadWaitstates);
1618 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForDef);
1621 switch (
VALU->getOpcode()) {
1622 case AMDGPU::V_READLANE_B32:
1623 case AMDGPU::V_READFIRSTLANE_B32: {
1624 MachineOperand *Src = TII.getNamedOperand(*VALU, AMDGPU::OpName::src0);
1626 int WaitStatesNeededForDef =
1627 VALUWriteVGPRReadlaneRead -
1628 getWaitStatesSince(IsVALUDefSGPRFn, VALUWriteVGPRReadlaneRead);
1629 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForDef);
1632 case AMDGPU::V_WRITELANE_B32: {
1634 int WaitStatesNeededForDef =
1635 VALUWriteEXECRWLane -
1636 getWaitStatesSince(IsVALUDefSGPRFn, VALUWriteEXECRWLane);
1637 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForDef);
1647 if (!ST.has12DWordStoreHazard())
1648 return WaitStatesNeeded;
1650 const MachineRegisterInfo &MRI = MF.getRegInfo();
1652 for (
const MachineOperand &Def :
VALU->defs()) {
1653 WaitStatesNeeded = std::max(WaitStatesNeeded, checkVALUHazardsHelper(Def, MRI));
1656 return WaitStatesNeeded;
1659int GCNHazardRecognizer::checkInlineAsmHazards(
MachineInstr *IA)
const {
1668 if (!ST.has12DWordStoreHazard() && !ST.hasDstSelForwardingHazard() &&
1669 !ST.hasCvtScaleForwardingHazard())
1672 const MachineRegisterInfo &MRI = MF.getRegInfo();
1673 int WaitStatesNeeded = 0;
1675 for (
const MachineOperand &
Op :
1677 if (
Op.isReg() &&
Op.isDef()) {
1678 if (!TRI.isVectorRegister(MRI,
Op.getReg()))
1681 if (ST.has12DWordStoreHazard()) {
1683 std::max(WaitStatesNeeded, checkVALUHazardsHelper(
Op, MRI));
1688 if (ST.hasDstSelForwardingHazard()) {
1689 const int Shift16DefWaitstates = 1;
1691 auto IsShift16BitDefFn = [
this, &
IA](
const MachineInstr &ProducerMI) {
1695 return IA->modifiesRegister(Dst->getReg(), &TRI) ||
1696 IA->readsRegister(Dst->getReg(), &TRI);
1698 if (ProducerMI.isInlineAsm()) {
1700 for (
auto &Def : ProducerMI.all_defs()) {
1701 if (
IA->modifiesRegister(
Def.getReg(), &TRI) ||
1702 IA->readsRegister(
Def.getReg(), &TRI)) {
1711 int WaitStatesNeededForDef =
1712 Shift16DefWaitstates -
1713 getWaitStatesSince(IsShift16BitDefFn, Shift16DefWaitstates);
1714 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForDef);
1717 return WaitStatesNeeded;
1720int GCNHazardRecognizer::checkRWLaneHazards(
MachineInstr *RWLane)
const {
1721 const SIInstrInfo *TII = ST.getInstrInfo();
1722 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1723 const MachineRegisterInfo &MRI = MF.getRegInfo();
1725 const MachineOperand *LaneSelectOp =
1726 TII->getNamedOperand(*RWLane, AMDGPU::OpName::src1);
1728 if (!LaneSelectOp->
isReg() || !TRI->isSGPRReg(MRI, LaneSelectOp->
getReg()))
1733 return TII->isVALU(
MI,
true);
1736 const int RWLaneWaitStates = 4;
1737 int WaitStatesSince = getWaitStatesSinceDef(LaneSelectReg,
IsHazardFn,
1739 return RWLaneWaitStates - WaitStatesSince;
1742int GCNHazardRecognizer::checkRFEHazards(
MachineInstr *RFE)
const {
1743 if (!ST.hasRFEHazards())
1746 const SIInstrInfo *TII = ST.getInstrInfo();
1748 const int RFEWaitStates = 1;
1753 int WaitStatesNeeded = getWaitStatesSinceSetReg(
IsHazardFn, RFEWaitStates);
1754 return RFEWaitStates - WaitStatesNeeded;
1757int GCNHazardRecognizer::checkReadM0Hazards(
MachineInstr *
MI)
const {
1758 const SIInstrInfo *TII = ST.getInstrInfo();
1759 const int ReadM0WaitStates = 1;
1760 auto IsHazardFn = [TII](
const MachineInstr &
MI) {
return TII->isSALU(
MI); };
1761 return ReadM0WaitStates -
1762 getWaitStatesSinceDef(AMDGPU::M0,
IsHazardFn, ReadM0WaitStates);
1767 int WaitStatesNeeded,
bool IsHoisting) {
1769 for (
int I = 0;
I < WaitStatesNeeded; ++
I)
1770 BuildMI(
MBB, InsertPt,
DL, TII.get(AMDGPU::V_NOP_e32));
1774 fixVMEMtoScalarWriteHazards(
MI);
1775 fixVcmpxPermlaneHazards(
MI);
1776 fixSMEMtoVectorWriteHazards(
MI);
1777 fixVcmpxExecWARHazard(
MI);
1778 fixLdsBranchVmemWARHazard(
MI);
1779 if (ST.hasLdsDirect()) {
1780 fixLdsDirectVALUHazard(
MI);
1781 fixLdsDirectVMEMHazard(
MI);
1783 fixVALUPartialForwardingHazard(
MI);
1784 fixVALUTransUseHazard(
MI);
1785 fixVALUTransCoexecutionHazards(
MI);
1787 fixWMMACoexecutionHazards(
MI);
1788 fixShift64HighRegBug(
MI);
1789 fixVALUMaskWriteHazard(
MI);
1790 fixRequiredExportPriority(
MI);
1791 if (ST.requiresWaitIdleBeforeGetReg())
1792 fixGetRegWaitIdle(
MI);
1793 if (ST.hasDsAtomicAsyncBarrierArriveB64PipeBug())
1794 fixDsAtomicAsyncBarrierArriveB64(
MI);
1795 if (ST.hasScratchBaseForwardingHazard())
1796 fixScratchBaseForwardingHazard(
MI);
1797 if (ST.setRegModeNeedsVNOPs())
1799 if (ST.hasNeedsTDMDrain())
1805 return (
TII.isVOPC(
MI) ||
1806 (
MI.isCompare() && (
TII.isVOP3(
MI) ||
TII.isSDWA(
MI)))) &&
1807 MI.modifiesRegister(AMDGPU::EXEC, &
TRI);
1810bool GCNHazardRecognizer::fixVcmpxPermlaneHazards(
MachineInstr *
MI) {
1814 const SIInstrInfo *TII = ST.getInstrInfo();
1815 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1821 unsigned Opc =
MI.getOpcode();
1823 Opc != AMDGPU::V_NOP_e32 &&
Opc != AMDGPU::V_NOP_e64 &&
1824 Opc != AMDGPU::V_NOP_sdwa;
1828 std::numeric_limits<int>::max())
1834 auto *Src0 = TII->getNamedOperand(*
MI, AMDGPU::OpName::src0);
1836 bool IsUndef = Src0->isUndef();
1838 TII->get(AMDGPU::V_MOV_B32_e32))
1845bool GCNHazardRecognizer::fixVMEMtoScalarWriteHazards(
MachineInstr *
MI) {
1846 if (!ST.hasVMEMtoScalarWriteHazard())
1848 assert(!ST.hasExtendedWaitCounts());
1853 if (
MI->getNumDefs() == 0)
1856 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1862 for (
const MachineOperand &Def :
MI->defs()) {
1863 const MachineOperand *
Op =
1864 I.findRegisterUseOperand(
Def.getReg(), TRI,
false);
1874 (
MI.getOpcode() == AMDGPU::S_WAITCNT &&
1875 !
MI.getOperand(0).getImm()) ||
1876 (
MI.getOpcode() == AMDGPU::S_WAITCNT_DEPCTR &&
1881 std::numeric_limits<int>::max())
1884 const SIInstrInfo *TII = ST.getInstrInfo();
1886 TII->get(AMDGPU::S_WAITCNT_DEPCTR))
1891bool GCNHazardRecognizer::fixSMEMtoVectorWriteHazards(
MachineInstr *
MI) {
1892 if (!ST.hasSMEMtoVectorWriteHazard())
1894 assert(!ST.hasExtendedWaitCounts());
1899 AMDGPU::OpName SDSTName;
1900 switch (
MI->getOpcode()) {
1901 case AMDGPU::V_READLANE_B32:
1902 case AMDGPU::V_READFIRSTLANE_B32:
1903 SDSTName = AMDGPU::OpName::vdst;
1906 SDSTName = AMDGPU::OpName::sdst;
1910 const SIInstrInfo *TII = ST.getInstrInfo();
1911 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1913 const MachineOperand *SDST = TII->getNamedOperand(*
MI, SDSTName);
1915 for (
const auto &MO :
MI->implicit_operands()) {
1916 if (MO.isDef() && TRI->isSGPRClass(TRI->getPhysRegBaseClass(MO.getReg()))) {
1927 auto IsHazardFn = [SDSTReg, TRI](
const MachineInstr &
I) {
1932 if (TII->isSALU(
MI)) {
1933 switch (
MI.getOpcode()) {
1934 case AMDGPU::S_SETVSKIP:
1935 case AMDGPU::S_VERSION:
1936 case AMDGPU::S_WAITCNT_VSCNT:
1937 case AMDGPU::S_WAITCNT_VMCNT:
1938 case AMDGPU::S_WAITCNT_EXPCNT:
1941 case AMDGPU::S_WAITCNT_LGKMCNT:
1943 return (
MI.getOperand(1).getImm() == 0) &&
1944 (
MI.getOperand(0).
getReg() == AMDGPU::SGPR_NULL);
1945 case AMDGPU::S_WAITCNT: {
1946 const int64_t
Imm =
MI.getOperand(0).getImm();
1953 MI.getOpcode() == AMDGPU::S_WAIT_IDLE) &&
1954 "unexpected wait count instruction");
1956 if (TII->isSOPP(
MI))
1972 std::numeric_limits<int>::max())
1976 TII->get(AMDGPU::S_MOV_B32), AMDGPU::SGPR_NULL)
1981bool GCNHazardRecognizer::fixVcmpxExecWARHazard(
MachineInstr *
MI) {
1982 if (!ST.hasVcmpxExecWARHazard())
1984 assert(!ST.hasExtendedWaitCounts());
1989 const SIRegisterInfo *TRI = ST.getRegisterInfo();
1990 if (!
MI->modifiesRegister(AMDGPU::EXEC, TRI))
1996 return I.readsRegister(AMDGPU::EXEC, TRI);
1999 const SIInstrInfo *TII = ST.getInstrInfo();
2000 auto IsExpiredFn = [TII, TRI](
const MachineInstr &
MI, int) {
2002 if (TII->getNamedOperand(
MI, AMDGPU::OpName::sdst))
2004 for (
auto MO :
MI.implicit_operands())
2005 if (MO.isDef() && TRI->isSGPRClass(TRI->getPhysRegBaseClass(MO.getReg())))
2008 if (
MI.getOpcode() == AMDGPU::S_WAITCNT_DEPCTR &&
2015 std::numeric_limits<int>::max())
2019 TII->get(AMDGPU::S_WAITCNT_DEPCTR))
2026 if (!ST.hasLdsBranchVmemWARHazard())
2031 bool HasLds =
false;
2032 bool HasVmem =
false;
2033 for (
auto &
MBB : MF) {
2034 for (
auto &
MI :
MBB) {
2037 if (HasLds && HasVmem)
2045 return I.getOpcode() == AMDGPU::S_WAITCNT_VSCNT &&
2046 I.getOperand(0).getReg() == AMDGPU::SGPR_NULL &&
2047 !
I.getOperand(1).getImm();
2050bool GCNHazardRecognizer::fixLdsBranchVmemWARHazard(
MachineInstr *
MI) {
2051 if (!RunLdsBranchVmemWARHazardFixup)
2054 assert(ST.hasLdsBranchVmemWARHazard());
2055 assert(!ST.hasExtendedWaitCounts());
2057 auto IsHazardInst = [](
const MachineInstr &
MI) {
2065 auto InstType = IsHazardInst(*
MI);
2069 auto IsExpiredFn = [&IsHazardInst](
const MachineInstr &
I, int) {
2073 auto IsHazardFn = [InstType, &IsHazardInst](
const MachineInstr &
I) {
2077 auto IsHazardFn = [InstType, IsHazardInst](
const MachineInstr &
I) {
2078 auto InstType2 = IsHazardInst(
I);
2079 return InstType2 && InstType != InstType2;
2082 auto IsExpiredFn = [InstType, &IsHazardInst](
const MachineInstr &
I, int) {
2083 auto InstType2 = IsHazardInst(
I);
2084 if (InstType == InstType2)
2091 std::numeric_limits<int>::max();
2095 std::numeric_limits<int>::max())
2098 const SIInstrInfo *TII = ST.getInstrInfo();
2100 TII->get(AMDGPU::S_WAITCNT_VSCNT))
2107bool GCNHazardRecognizer::fixLdsDirectVALUHazard(
MachineInstr *
MI) {
2111 const int NoHazardWaitStates = 15;
2112 const MachineOperand *VDST = TII.getNamedOperand(*
MI, AMDGPU::OpName::vdst);
2115 bool VisitedTrans =
false;
2116 auto IsHazardFn = [
this, VDSTReg, &VisitedTrans](
const MachineInstr &
I) {
2121 return I.readsRegister(VDSTReg, &TRI) ||
I.modifiesRegister(VDSTReg, &TRI);
2123 auto IsExpiredFn = [&](
const MachineInstr &
I,
int WaitStates) {
2124 if (WaitStates >= NoHazardWaitStates)
2130 auto GetWaitStatesFn = [](
const MachineInstr &
MI) {
2134 DenseSet<const MachineBasicBlock *> Visited;
2136 std::next(
MI->getReverseIterator()), 0,
2144 MachineOperand *WaitVdstOp =
2145 TII.getNamedOperand(*
MI, AMDGPU::OpName::waitvdst);
2146 WaitVdstOp->
setImm(std::min(
Count, NoHazardWaitStates));
2151bool GCNHazardRecognizer::fixLdsDirectVMEMHazard(
MachineInstr *
MI) {
2155 const MachineOperand *VDST = TII.getNamedOperand(*
MI, AMDGPU::OpName::vdst);
2158 auto IsHazardFn = [
this, VDSTReg](
const MachineInstr &
I) {
2161 return I.readsRegister(VDSTReg, &TRI) ||
I.modifiesRegister(VDSTReg, &TRI);
2163 bool LdsdirCanWait = ST.hasLdsWaitVMSRC();
2166 auto IsExpiredFn = [
this, LdsdirCanWait](
const MachineInstr &
I, int) {
2169 (
I.getOpcode() == AMDGPU::S_WAITCNT && !
I.getOperand(0).getImm()) ||
2170 (
I.getOpcode() == AMDGPU::S_WAITCNT_DEPCTR &&
2173 !TII.getNamedOperand(
I, AMDGPU::OpName::waitvsrc)->getImm());
2177 std::numeric_limits<int>::max())
2180 if (LdsdirCanWait) {
2181 TII.getNamedOperand(*
MI, AMDGPU::OpName::waitvsrc)->setImm(0);
2184 TII.get(AMDGPU::S_WAITCNT_DEPCTR))
2191bool GCNHazardRecognizer::fixVALUPartialForwardingHazard(
MachineInstr *
MI) {
2192 if (!ST.hasVALUPartialForwardingHazard())
2194 assert(!ST.hasExtendedWaitCounts());
2199 SmallSetVector<Register, 4> SrcVGPRs;
2201 for (
const MachineOperand &Use :
MI->explicit_uses()) {
2202 if (
Use.isReg() && TRI.isVGPR(MF.getRegInfo(),
Use.getReg()))
2207 if (SrcVGPRs.
size() <= 1)
2225 const int Intv1plus2MaxVALUs = 2;
2226 const int Intv3MaxVALUs = 4;
2227 const int IntvMaxVALUs = 6;
2228 const int NoHazardVALUWaitStates = IntvMaxVALUs + 2;
2231 SmallDenseMap<Register, int, 4> DefPos;
2232 int ExecPos = std::numeric_limits<int>::max();
2235 static unsigned getHashValue(
const StateType &State) {
2239 static bool isEqual(
const StateType &
LHS,
const StateType &
RHS) {
2240 return LHS.DefPos ==
RHS.DefPos &&
LHS.ExecPos ==
RHS.ExecPos &&
2248 auto IsHazardFn = [&,
this](StateType &State,
const MachineInstr &
I) {
2250 if (State.VALUs > NoHazardVALUWaitStates)
2256 (
I.getOpcode() == AMDGPU::S_WAITCNT_DEPCTR &&
2264 if (!State.DefPos.count(Src) &&
I.modifiesRegister(Src, &TRI)) {
2265 State.DefPos[Src] = State.VALUs;
2270 if (State.ExecPos == std::numeric_limits<int>::max()) {
2271 if (!State.DefPos.empty() &&
I.modifiesRegister(AMDGPU::EXEC, &TRI)) {
2272 State.ExecPos = State.VALUs;
2279 if (State.VALUs > Intv3MaxVALUs && State.DefPos.empty())
2287 if (State.ExecPos == std::numeric_limits<int>::max())
2290 int PreExecPos = std::numeric_limits<int>::max();
2291 int PostExecPos = std::numeric_limits<int>::max();
2293 for (
auto Entry : State.DefPos) {
2294 int DefVALUs =
Entry.second;
2295 if (DefVALUs != std::numeric_limits<int>::max()) {
2296 if (DefVALUs >= State.ExecPos)
2297 PreExecPos = std::min(PreExecPos, DefVALUs);
2299 PostExecPos = std::min(PostExecPos, DefVALUs);
2304 if (PostExecPos == std::numeric_limits<int>::max())
2308 int Intv3VALUs = PostExecPos;
2309 if (Intv3VALUs > Intv3MaxVALUs)
2313 int Intv2VALUs = (State.ExecPos - PostExecPos) - 1;
2314 if (Intv2VALUs > Intv1plus2MaxVALUs)
2318 if (PreExecPos == std::numeric_limits<int>::max())
2322 int Intv1VALUs = PreExecPos - State.ExecPos;
2323 if (Intv1VALUs > Intv1plus2MaxVALUs)
2327 if (Intv1VALUs + Intv2VALUs > Intv1plus2MaxVALUs)
2332 auto UpdateStateFn = [](StateType &State,
const MachineInstr &
MI) {
2338 std::next(
MI->getReverseIterator())))
2342 TII.get(AMDGPU::S_WAITCNT_DEPCTR))
2348bool GCNHazardRecognizer::fixVALUTransUseHazard(
MachineInstr *
MI) {
2349 if (!ST.hasVALUTransUseHazard())
2351 assert(!ST.hasExtendedWaitCounts());
2356 SmallSet<Register, 4> SrcVGPRs;
2358 for (
const MachineOperand &Use :
MI->explicit_uses()) {
2359 if (
Use.isReg() && TRI.isVGPR(MF.getRegInfo(),
Use.getReg()))
2373 const int IntvMaxVALUs = 5;
2374 const int IntvMaxTRANS = 1;
2380 static unsigned getHashValue(
const StateType &State) {
2383 static bool isEqual(
const StateType &
LHS,
const StateType &
RHS) {
2384 return LHS.VALUs ==
RHS.VALUs &&
LHS.TRANS ==
RHS.TRANS;
2391 auto IsHazardFn = [&,
this](StateType &State,
const MachineInstr &
I) {
2393 if (State.VALUs > IntvMaxVALUs || State.TRANS > IntvMaxTRANS)
2399 (
I.getOpcode() == AMDGPU::S_WAITCNT_DEPCTR &&
2406 if (
I.modifiesRegister(Src, &TRI)) {
2414 auto UpdateStateFn = [](StateType &State,
const MachineInstr &
MI) {
2422 std::next(
MI->getReverseIterator())))
2428 TII.get(AMDGPU::S_WAITCNT_DEPCTR))
2434bool GCNHazardRecognizer::fixVALUTransCoexecutionHazards(
MachineInstr *
MI) {
2435 if (!ST.hasTransCoexecutionHazard() ||
2440 const SIInstrInfo *TII = ST.getInstrInfo();
2441 const SIRegisterInfo *TRI = ST.getRegisterInfo();
2443 auto IsTransHazardFn = [
MI, TII, TRI](
const MachineInstr &
I) {
2448 Register TransDef = TII->getNamedOperand(
I, AMDGPU::OpName::vdst)->getReg();
2449 for (
const MachineOperand &ValuUse :
MI->explicit_uses()) {
2450 if (ValuUse.isReg() && TRI->regsOverlap(TransDef, ValuUse.getReg()))
2454 auto *ValuDst = TII->getNamedOperand(*
MI, AMDGPU::OpName::vdst);
2455 if (!ValuDst || !ValuDst->isReg())
2459 Register ValuDef = ValuDst->getReg();
2460 for (
const MachineOperand &TransUse :
I.explicit_uses()) {
2461 if (TransUse.isReg() && TRI->regsOverlap(ValuDef, TransUse.getReg()))
2472 const int HasVALU = std::numeric_limits<int>::max();
2473 if (::getWaitStatesSince(IsTransHazardFn,
MI,
IsExpiredFn) == HasVALU)
2476 BuildMI(*
MI->getParent(),
MI,
MI->getDebugLoc(), TII->get(AMDGPU::V_NOP_e32));
2484 const SIInstrInfo *TII = ST.getInstrInfo();
2485 const SIRegisterInfo *TRI = ST.getRegisterInfo();
2487 auto IsHazardFn = [
MI, TII, TRI,
this](
const MachineInstr &
I) {
2494 TII->getNamedOperand(*
MI, AMDGPU::OpName::src0)->getReg();
2496 TII->getNamedOperand(*
MI, AMDGPU::OpName::src1)->getReg();
2499 TII->getNamedOperand(
I, AMDGPU::OpName::vdst)->getReg();
2501 if (TRI->regsOverlap(PrevDstReg, CurSrc0Reg) ||
2502 TRI->regsOverlap(PrevDstReg, CurSrc1Reg)) {
2511 TII->getNamedOperand(*
MI, AMDGPU::OpName::src2)->getReg();
2512 if (TRI->regsOverlap(PrevDstReg, CurIndex))
2526 std::numeric_limits<int>::max())
2529 BuildMI(*
MI->getParent(),
MI,
MI->getDebugLoc(), TII->get(AMDGPU::V_NOP_e32));
2584 bool IsLowestRateWMMA = ST.hasGFX125xLowestRateWMMA();
2585 unsigned Category = 0;
2587 unsigned Latency = SchedModel.computeInstrLatency(&
MI);
2592 assert(!IsSWMMAC &&
"no 4-cycle SWMMAC expected");
2596 Category = IsSWMMAC ? 2 : 0;
2599 Category = IsLowestRateWMMA ? 4 : (IsSWMMAC ? 3 : 1);
2602 assert(IsLowestRateWMMA &&
"latency 32 is not expected");
2612int GCNHazardRecognizer::checkWMMACoexecutionHazards(
MachineInstr *
MI)
const {
2613 if (!ST.hasWMMACoexecutionHazards())
2616 const SIInstrInfo *TII = ST.getInstrInfo();
2625 const int WMMAWaitStates[] = {5, 9, 3, 5, 9, 17, 2};
2626 const int VALUWaitStates[] = {4, 8, 2, 4, 8, 16, 1};
2627 unsigned Category = 0;
2629 auto IsWMMAHazardFn = [
MI, TII, &Category,
this](
const MachineInstr &
I) {
2630 if (!TII->isXDLWMMA(
I))
2634 return hasWMMAToWMMARegOverlap(
I, *
MI);
2637 auto IsVALUHazardFn = [
MI, TII, &Category,
this](
const MachineInstr &
I) {
2638 if (!TII->isXDLWMMA(
I))
2642 return hasWMMAToVALURegOverlap(
I, *
MI);
2645 int WaitStatesNeeded = -1;
2646 int ExistingVALUs = 0;
2647 bool IsLowestRateWMMA = ST.hasGFX125xLowestRateWMMA();
2655 if (TII->isXDLWMMA(*
MI)) {
2657 const int WMMAWaitsLimit = IsLowestRateWMMA ? 17 : 9;
2658 ExistingVALUs = getWaitStatesSinceVALU(IsWMMAHazardFn, WMMAWaitsLimit);
2659 WaitStatesNeeded = WMMAWaitStates[Category] - ExistingVALUs;
2662 const int VALUWaitsLimit = IsLowestRateWMMA ? 16 : 8;
2663 ExistingVALUs = getWaitStatesSinceVALU(IsVALUHazardFn, VALUWaitsLimit);
2664 WaitStatesNeeded = VALUWaitStates[Category] - ExistingVALUs;
2667 return WaitStatesNeeded;
2670bool GCNHazardRecognizer::hasWMMAToWMMARegOverlap(
2672 Register D0 = TII.getNamedOperand(WMMA, AMDGPU::OpName::vdst)->getReg();
2673 Register A1 = TII.getNamedOperand(
MI, AMDGPU::OpName::src0)->getReg();
2674 Register B1 = TII.getNamedOperand(
MI, AMDGPU::OpName::src1)->getReg();
2677 if (TRI.regsOverlap(D0, A1) || TRI.regsOverlap(D0, B1))
2681 Register Idx1 = TII.getNamedOperand(
MI, AMDGPU::OpName::src2)->getReg();
2682 if (TRI.regsOverlap(D0, Idx1))
2688bool GCNHazardRecognizer::hasWMMAToVALURegOverlap(
2691 Register D0 = TII.getNamedOperand(WMMA, AMDGPU::OpName::vdst)->getReg();
2692 for (
const MachineOperand &ValuUse :
MI.explicit_uses()) {
2693 if (ValuUse.isReg() && TRI.regsOverlap(D0, ValuUse.getReg()))
2698 Register A0 = TII.getNamedOperand(WMMA, AMDGPU::OpName::src0)->getReg();
2699 Register B0 = TII.getNamedOperand(WMMA, AMDGPU::OpName::src1)->getReg();
2703 Register Idx0 = TII.getNamedOperand(WMMA, AMDGPU::OpName::src2)->getReg();
2704 WMMARegs.push_back(Idx0);
2707 for (
const MachineOperand &ValuDef :
MI.defs()) {
2708 Register VDstReg = ValuDef.getReg();
2709 for (
Register WMMAReg : WMMARegs) {
2710 if (TRI.regsOverlap(VDstReg, WMMAReg))
2717bool GCNHazardRecognizer::isCoexecutionHazardFor(
const MachineInstr &
I,
2721 if (!TII.isXDLWMMA(
I))
2725 if (TII.isXDLWMMA(
MI))
2726 return hasWMMAToWMMARegOverlap(
I,
MI);
2728 return hasWMMAToVALURegOverlap(
I,
MI);
2734 bool IncludeSubloops) {
2737 for (MachineBasicBlock *
MBB :
L->getBlocks()) {
2738 if (!IncludeSubloops && MLI->getLoopFor(
MBB) != L)
2740 for (MachineInstr &
I : *
MBB) {
2743 if (isCoexecutionHazardFor(
I, *
MI))
2750bool GCNHazardRecognizer::tryHoistWMMAVnopsFromLoop(
MachineInstr *
MI,
2751 int WaitStatesNeeded) {
2755 MachineLoop *
L = MLI->getLoopFor(
MI->getParent());
2757 ++NumWMMAHoistingBailed;
2762 if (hasWMMAHazardInLoop(L,
MI)) {
2763 ++NumWMMAHoistingBailed;
2768 MachineLoop *TargetLoop =
L;
2770 if (hasWMMAHazardInLoop(Parent,
MI,
false))
2772 TargetLoop = Parent;
2778 ++NumWMMAHoistingBailed;
2782 LLVM_DEBUG(
dbgs() <<
"WMMA V_NOP Hoisting: Moving " << WaitStatesNeeded
2788 NumWMMANopsHoisted += WaitStatesNeeded;
2792bool GCNHazardRecognizer::fixWMMACoexecutionHazards(
MachineInstr *
MI) {
2793 int WaitStatesNeeded = checkWMMACoexecutionHazards(
MI);
2794 if (WaitStatesNeeded <= 0)
2800 emitVNops(*
MI->getParent(),
MI->getIterator(), WaitStatesNeeded);
2804bool GCNHazardRecognizer::fixShift64HighRegBug(
MachineInstr *
MI) {
2805 if (!ST.hasShift64HighRegBug())
2807 assert(!ST.hasExtendedWaitCounts());
2809 switch (
MI->getOpcode()) {
2812 case AMDGPU::V_LSHLREV_B64_e64:
2813 case AMDGPU::V_LSHRREV_B64_e64:
2814 case AMDGPU::V_ASHRREV_I64_e64:
2818 MachineOperand *Amt = TII.getNamedOperand(*
MI, AMDGPU::OpName::src0);
2823 const MachineRegisterInfo &MRI = MF.getRegInfo();
2825 if (!TRI.isVGPR(MRI, AmtReg) || ((AmtReg - AMDGPU::VGPR0) & 7) != 7)
2828 if (AmtReg != AMDGPU::VGPR255 && MRI.
isPhysRegUsed(AmtReg + 1))
2831 assert(ST.needsAlignedVGPRs());
2832 static_assert(AMDGPU::VGPR0 + 1 == AMDGPU::VGPR1);
2836 MachineOperand *Src1 = TII.getNamedOperand(*
MI, AMDGPU::OpName::src1);
2847 Register DstReg =
MI->getOperand(0).getReg();
2849 Register DstLo = TRI.getSubReg(DstReg, AMDGPU::sub0);
2857 bool Overlapped =
MI->modifiesRegister(AmtReg, &TRI);
2859 for (MCRegister
Reg : Overlapped ? AMDGPU::VReg_64_Align2RegClass
2860 : AMDGPU::VGPR_32RegClass) {
2861 if (!
MI->modifiesRegister(
Reg, &TRI) && !
MI->readsRegister(
Reg, &TRI)) {
2867 Register NewAmt = Overlapped ? (
Register)TRI.getSubReg(NewReg, AMDGPU::sub1)
2872 NewAmtLo = TRI.getSubReg(NewReg, AMDGPU::sub0);
2885 runOnInstruction(
BuildMI(*
MBB,
MI,
DL, TII.get(AMDGPU::V_SWAP_B32), NewAmt)
2892 BuildMI(*
MBB, std::next(
MI->getIterator()),
DL, TII.get(AMDGPU::V_SWAP_B32),
2898 BuildMI(*
MBB, std::next(
MI->getIterator()),
DL, TII.get(AMDGPU::V_SWAP_B32),
2912 MI->getOperand(0).setReg(NewReg);
2921int GCNHazardRecognizer::checkNSAtoVMEMHazard(
MachineInstr *
MI)
const {
2922 int NSAtoVMEMWaitStates = 1;
2924 if (!ST.hasNSAtoVMEMBug())
2930 const SIInstrInfo *TII = ST.getInstrInfo();
2931 const auto *
Offset = TII->getNamedOperand(*
MI, AMDGPU::OpName::offset);
2939 return Info->MIMGEncoding == AMDGPU::MIMGEncGfx10NSA &&
2940 TII->getInstSizeInBytes(
I) >= 16;
2943 return NSAtoVMEMWaitStates - getWaitStatesSince(
IsHazardFn, 1);
2946int GCNHazardRecognizer::checkFPAtomicToDenormModeHazard(
2948 int FPAtomicToDenormModeWaitStates = 3;
2950 if (!ST.hasFPAtomicToDenormModeHazard())
2952 assert(!ST.hasExtendedWaitCounts());
2954 if (
MI->getOpcode() != AMDGPU::S_DENORM_MODE)
2963 auto IsExpiredFn = [](
const MachineInstr &
MI,
int WaitStates) {
2970 return FPAtomicToDenormModeWaitStates -
2974int GCNHazardRecognizer::checkMAIHazards(
MachineInstr *
MI)
const {
2977 return ST.hasGFX90AInsts() ? checkMAIHazards90A(
MI) : checkMAIHazards908(
MI);
2980int GCNHazardRecognizer::checkMFMAPadding(
MachineInstr *
MI)
const {
2985 const SIMachineFunctionInfo *MFI = MF.getInfo<SIMachineFunctionInfo>();
2989 int NeighborMFMALatency = 0;
2990 auto IsNeighboringMFMA = [&NeighborMFMALatency,
2991 this](
const MachineInstr &
MI) {
2995 NeighborMFMALatency = this->getMFMAPipelineWaitStates(
MI);
2999 const int MaxMFMAPipelineWaitStates = 16;
3000 int WaitStatesSinceNeighborMFMA =
3001 getWaitStatesSince(IsNeighboringMFMA, MaxMFMAPipelineWaitStates);
3003 int NeighborMFMAPaddingNeeded =
3005 WaitStatesSinceNeighborMFMA;
3007 return std::max(0, NeighborMFMAPaddingNeeded);
3010int GCNHazardRecognizer::checkMAIHazards908(
MachineInstr *
MI)
const {
3011 int WaitStatesNeeded = 0;
3012 unsigned Opc =
MI->getOpcode();
3014 auto IsVALUFn = [](
const MachineInstr &
MI) {
3018 if (
Opc != AMDGPU::V_ACCVGPR_READ_B32_e64) {
3019 const int LegacyVALUWritesVGPRWaitStates = 2;
3020 const int VALUWritesExecWaitStates = 4;
3021 const int MaxWaitStates = 4;
3023 int WaitStatesNeededForUse = VALUWritesExecWaitStates -
3024 getWaitStatesSinceDef(AMDGPU::EXEC, IsVALUFn, MaxWaitStates);
3025 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3027 if (WaitStatesNeeded < MaxWaitStates) {
3028 for (
const MachineOperand &Use :
MI->explicit_uses()) {
3029 const int MaxWaitStates = 2;
3031 if (!
Use.isReg() || !TRI.isVGPR(MF.getRegInfo(),
Use.getReg()))
3034 int WaitStatesNeededForUse = LegacyVALUWritesVGPRWaitStates -
3035 getWaitStatesSinceDef(
Use.getReg(), IsVALUFn, MaxWaitStates);
3036 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3038 if (WaitStatesNeeded == MaxWaitStates)
3044 for (
const MachineOperand &
Op :
MI->explicit_operands()) {
3045 if (!
Op.isReg() || !TRI.isAGPR(MF.getRegInfo(),
Op.getReg()))
3048 if (
Op.isDef() &&
Opc != AMDGPU::V_ACCVGPR_WRITE_B32_e64)
3051 const int MFMAWritesAGPROverlappedSrcABWaitStates = 4;
3052 const int MFMAWritesAGPROverlappedSrcCWaitStates = 2;
3053 const int MFMA4x4WritesAGPRAccVgprReadWaitStates = 4;
3054 const int MFMA16x16WritesAGPRAccVgprReadWaitStates = 10;
3055 const int MFMA32x32WritesAGPRAccVgprReadWaitStates = 18;
3056 const int MFMA4x4WritesAGPRAccVgprWriteWaitStates = 1;
3057 const int MFMA16x16WritesAGPRAccVgprWriteWaitStates = 7;
3058 const int MFMA32x32WritesAGPRAccVgprWriteWaitStates = 15;
3059 const int MaxWaitStates = 18;
3061 unsigned HazardDefLatency = 0;
3063 auto IsOverlappedMFMAFn = [
Reg, &HazardDefLatency,
3064 this](
const MachineInstr &
MI) {
3071 std::max(HazardDefLatency, TSchedModel.computeInstrLatency(&
MI));
3072 return TRI.regsOverlap(DstReg,
Reg);
3075 int WaitStatesSinceDef = getWaitStatesSinceDef(
Reg, IsOverlappedMFMAFn,
3077 int NeedWaitStates = MFMAWritesAGPROverlappedSrcABWaitStates;
3078 int SrcCIdx = AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::src2);
3079 int OpNo =
Op.getOperandNo();
3080 if (OpNo == SrcCIdx) {
3081 NeedWaitStates = MFMAWritesAGPROverlappedSrcCWaitStates;
3082 }
else if (
Opc == AMDGPU::V_ACCVGPR_READ_B32_e64) {
3083 switch (HazardDefLatency) {
3084 case 2: NeedWaitStates = MFMA4x4WritesAGPRAccVgprReadWaitStates;
3086 case 8: NeedWaitStates = MFMA16x16WritesAGPRAccVgprReadWaitStates;
3088 case 16: [[fallthrough]];
3089 default: NeedWaitStates = MFMA32x32WritesAGPRAccVgprReadWaitStates;
3092 }
else if (
Opc == AMDGPU::V_ACCVGPR_WRITE_B32_e64) {
3093 switch (HazardDefLatency) {
3094 case 2: NeedWaitStates = MFMA4x4WritesAGPRAccVgprWriteWaitStates;
3096 case 8: NeedWaitStates = MFMA16x16WritesAGPRAccVgprWriteWaitStates;
3098 case 16: [[fallthrough]];
3099 default: NeedWaitStates = MFMA32x32WritesAGPRAccVgprWriteWaitStates;
3104 int WaitStatesNeededForUse = NeedWaitStates - WaitStatesSinceDef;
3105 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3107 if (WaitStatesNeeded == MaxWaitStates)
3108 return WaitStatesNeeded;
3110 auto IsAccVgprWriteFn = [
Reg,
this](
const MachineInstr &
MI) {
3111 if (
MI.getOpcode() != AMDGPU::V_ACCVGPR_WRITE_B32_e64)
3114 return TRI.regsOverlap(
Reg, DstReg);
3117 const int AccVGPRWriteMFMAReadSrcCWaitStates = 1;
3118 const int AccVGPRWriteMFMAReadSrcABWaitStates = 3;
3119 const int AccVGPRWriteAccVgprReadWaitStates = 3;
3120 NeedWaitStates = AccVGPRWriteMFMAReadSrcABWaitStates;
3121 if (OpNo == SrcCIdx)
3122 NeedWaitStates = AccVGPRWriteMFMAReadSrcCWaitStates;
3123 else if (
Opc == AMDGPU::V_ACCVGPR_READ_B32_e64)
3124 NeedWaitStates = AccVGPRWriteAccVgprReadWaitStates;
3126 WaitStatesNeededForUse = NeedWaitStates -
3127 getWaitStatesSinceDef(
Reg, IsAccVgprWriteFn, MaxWaitStates);
3128 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3130 if (WaitStatesNeeded == MaxWaitStates)
3131 return WaitStatesNeeded;
3134 if (
Opc == AMDGPU::V_ACCVGPR_WRITE_B32_e64) {
3135 const int MFMA4x4ReadSrcCAccVgprWriteWaitStates = 0;
3136 const int MFMA16x16ReadSrcCAccVgprWriteWaitStates = 5;
3137 const int MFMA32x32ReadSrcCAccVgprWriteWaitStates = 13;
3138 const int MaxWaitStates = 13;
3139 Register DstReg =
MI->getOperand(0).getReg();
3140 unsigned HazardDefLatency = 0;
3142 auto IsSrcCMFMAFn = [DstReg, &HazardDefLatency,
3143 this](
const MachineInstr &
MI) {
3146 Register Reg = TII.getNamedOperand(
MI, AMDGPU::OpName::src2)->getReg();
3148 std::max(HazardDefLatency, TSchedModel.computeInstrLatency(&
MI));
3149 return TRI.regsOverlap(
Reg, DstReg);
3152 int WaitStatesSince = getWaitStatesSince(IsSrcCMFMAFn, MaxWaitStates);
3154 switch (HazardDefLatency) {
3155 case 2: NeedWaitStates = MFMA4x4ReadSrcCAccVgprWriteWaitStates;
3157 case 8: NeedWaitStates = MFMA16x16ReadSrcCAccVgprWriteWaitStates;
3159 case 16: [[fallthrough]];
3160 default: NeedWaitStates = MFMA32x32ReadSrcCAccVgprWriteWaitStates;
3164 int WaitStatesNeededForUse = NeedWaitStates - WaitStatesSince;
3165 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3169 WaitStatesNeeded = std::max(WaitStatesNeeded, checkMFMAPadding(
MI));
3171 return WaitStatesNeeded;
3182 return NumPasses + 1 + IsGFX950;
3193 return NumPasses + 1 + (NumPasses != 2 && IsGFX950);
3211 return NumPasses + 2;
3221 return NumPasses + 3 + (NumPasses != 2 && IsGFX950);
3224int GCNHazardRecognizer::checkMAIHazards90A(
MachineInstr *
MI)
const {
3225 int WaitStatesNeeded = 0;
3226 unsigned Opc =
MI->getOpcode();
3228 auto IsLegacyVALUFn = [](
const MachineInstr &
MI) {
3233 auto IsLegacyVALUNotDotFn = [](
const MachineInstr &
MI) {
3239 return WaitStatesNeeded;
3241 const int VALUWritesExecWaitStates = 4;
3242 int WaitStatesNeededForUse = VALUWritesExecWaitStates -
3243 getWaitStatesSinceDef(AMDGPU::EXEC, IsLegacyVALUFn,
3244 VALUWritesExecWaitStates);
3245 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3247 int SrcCIdx = AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::src2);
3250 for (
const MachineOperand &Use :
MI->explicit_uses()) {
3251 const int LegacyVALUNotDotWritesVGPRWaitStates = 2;
3252 const int SMFMA4x4WritesVGPROverlappedSMFMASrcCWaitStates = 2;
3253 const int SMFMA16x16WritesVGPROverlappedSMFMASrcCWaitStates = 8;
3254 const int SMFMA32x32WritesVGPROverlappedSMFMASrcCWaitStates = 16;
3255 const int SMFMA4x4WritesVGPROverlappedDMFMASrcCWaitStates = 3;
3256 const int SMFMA16x16WritesVGPROverlappedDMFMASrcCWaitStates = 9;
3257 const int SMFMA32x32WritesVGPROverlappedDMFMASrcCWaitStates = 17;
3258 const int DMFMA16x16WritesVGPROverlappedSrcCWaitStates = 9;
3259 const int GFX950_DMFMA16x16WritesVGPROverlappedSrcCWaitStates = 17;
3260 const int DMFMA4x4WritesVGPROverlappedSrcCWaitStates = 4;
3261 const int SMFMA4x4WritesVGPROverlappedSrcABWaitStates = 5;
3262 const int SMFMA16x16WritesVGPROverlappedSrcABWaitStates = 11;
3263 const int SMFMA32x32WritesVGPROverlappedSrcABWaitStates = 19;
3264 const int DMFMA4x4WritesVGPROverlappedMFMASrcABWaitStates = 6;
3265 const int DMFMA16x16WritesVGPROverlappedMFMASrcABWaitStates = 11;
3266 const int GFX950_DMFMA16x16WritesVGPROverlappedMFMASrcABWaitStates = 19;
3267 const int DMFMA4x4WritesVGPRFullSrcCWaitStates = 4;
3268 const int GFX940_SMFMA4x4WritesVGPRFullSrcCWaitStates = 2;
3269 const int MaxWaitStates = 19;
3275 const MachineInstr *MI1;
3277 auto IsOverlappedMFMAFn = [
Reg, &FullReg, &MI1,
3278 this](
const MachineInstr &
MI) {
3282 FullReg = (DstReg ==
Reg);
3284 return TRI.regsOverlap(DstReg,
Reg);
3287 WaitStatesNeededForUse = LegacyVALUNotDotWritesVGPRWaitStates -
3288 getWaitStatesSinceDef(
Reg, IsLegacyVALUNotDotFn, MaxWaitStates);
3289 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3292 getWaitStatesSinceDef(
Reg, IsOverlappedMFMAFn, MaxWaitStates);
3293 if (NumWaitStates == std::numeric_limits<int>::max())
3296 int OpNo =
Use.getOperandNo();
3298 int NeedWaitStates = 0;
3299 if (OpNo == SrcCIdx) {
3303 }
else if (FullReg) {
3304 if ((
Opc == AMDGPU::V_MFMA_F64_4X4X4F64_e64 ||
3305 Opc == AMDGPU::V_MFMA_F64_4X4X4F64_vgprcd_e64) &&
3306 (Opc1 == AMDGPU::V_MFMA_F64_4X4X4F64_e64 ||
3307 Opc1 == AMDGPU::V_MFMA_F64_4X4X4F64_vgprcd_e64))
3308 NeedWaitStates = DMFMA4x4WritesVGPRFullSrcCWaitStates;
3309 else if (ST.hasGFX940Insts() &&
3310 TSchedModel.computeInstrLatency(MI1) == 2)
3311 NeedWaitStates = GFX940_SMFMA4x4WritesVGPRFullSrcCWaitStates;
3314 case AMDGPU::V_MFMA_F64_16X16X4F64_e64:
3315 case AMDGPU::V_MFMA_F64_16X16X4F64_vgprcd_e64:
3316 case AMDGPU::V_MFMA_F64_16X16X4F64_mac_e64:
3317 case AMDGPU::V_MFMA_F64_16X16X4F64_mac_vgprcd_e64:
3318 if (!TII.isXDL(*
MI))
3321 ? GFX950_DMFMA16x16WritesVGPROverlappedSrcCWaitStates
3322 : DMFMA16x16WritesVGPROverlappedSrcCWaitStates;
3324 case AMDGPU::V_MFMA_F64_4X4X4F64_e64:
3325 case AMDGPU::V_MFMA_F64_4X4X4F64_vgprcd_e64:
3326 if (!TII.isXDL(*
MI))
3327 NeedWaitStates = DMFMA4x4WritesVGPROverlappedSrcCWaitStates;
3330 int NumPasses = TSchedModel.computeInstrLatency(MI1);
3331 if (ST.hasGFX940Insts()) {
3332 if (TII.isXDL(*
MI) && !TII.isXDL(*MI1))
3339 NumPasses, ST.hasGFX950Insts())
3341 NumPasses, ST.hasGFX950Insts()))
3347 switch (NumPasses) {
3351 ? SMFMA4x4WritesVGPROverlappedDMFMASrcCWaitStates
3352 : SMFMA4x4WritesVGPROverlappedSMFMASrcCWaitStates;
3357 ? SMFMA16x16WritesVGPROverlappedDMFMASrcCWaitStates
3358 : SMFMA16x16WritesVGPROverlappedSMFMASrcCWaitStates;
3363 ? SMFMA32x32WritesVGPROverlappedDMFMASrcCWaitStates
3364 : SMFMA32x32WritesVGPROverlappedSMFMASrcCWaitStates;
3373 case AMDGPU::V_MFMA_F64_16X16X4F64_e64:
3374 case AMDGPU::V_MFMA_F64_16X16X4F64_vgprcd_e64:
3375 case AMDGPU::V_MFMA_F64_16X16X4F64_mac_e64:
3376 case AMDGPU::V_MFMA_F64_16X16X4F64_mac_vgprcd_e64:
3379 ? GFX950_DMFMA16x16WritesVGPROverlappedMFMASrcABWaitStates
3380 : DMFMA16x16WritesVGPROverlappedMFMASrcABWaitStates;
3382 case AMDGPU::V_MFMA_F64_4X4X4F64_e64:
3383 case AMDGPU::V_MFMA_F64_4X4X4F64_vgprcd_e64:
3384 NeedWaitStates = DMFMA4x4WritesVGPROverlappedMFMASrcABWaitStates;
3387 int NumPasses = TSchedModel.computeInstrLatency(MI1);
3389 if (ST.hasGFX940Insts()) {
3393 NumPasses, ST.hasGFX950Insts())
3399 switch (NumPasses) {
3401 NeedWaitStates = SMFMA4x4WritesVGPROverlappedSrcABWaitStates;
3406 NeedWaitStates = SMFMA16x16WritesVGPROverlappedSrcABWaitStates;
3410 NeedWaitStates = SMFMA32x32WritesVGPROverlappedSrcABWaitStates;
3414 if (WaitStatesNeeded >= NeedWaitStates)
3417 WaitStatesNeededForUse = NeedWaitStates - NumWaitStates;
3418 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3420 if (WaitStatesNeeded == MaxWaitStates)
3425 WaitStatesNeeded = std::max(WaitStatesNeeded, checkMFMAPadding(
MI));
3427 return WaitStatesNeeded;
3430int GCNHazardRecognizer::checkMAILdStHazards(
MachineInstr *
MI)
const {
3432 if (!ST.hasMAIInsts() || ST.hasGFX90AInsts())
3435 int WaitStatesNeeded = 0;
3437 auto IsAccVgprReadFn = [](
const MachineInstr &
MI) {
3438 return MI.getOpcode() == AMDGPU::V_ACCVGPR_READ_B32_e64;
3441 for (
const MachineOperand &
Op :
MI->explicit_uses()) {
3442 if (!
Op.isReg() || !TRI.isVGPR(MF.getRegInfo(),
Op.getReg()))
3447 const int AccVgprReadLdStWaitStates = 2;
3448 const int VALUWriteAccVgprRdWrLdStDepVALUWaitStates = 1;
3449 const int MaxWaitStates = 2;
3451 int WaitStatesNeededForUse = AccVgprReadLdStWaitStates -
3452 getWaitStatesSinceDef(
Reg, IsAccVgprReadFn, MaxWaitStates);
3453 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3455 if (WaitStatesNeeded == MaxWaitStates)
3456 return WaitStatesNeeded;
3458 auto IsVALUAccVgprRdWrCheckFn = [
Reg,
this](
const MachineInstr &
MI) {
3459 if (
MI.getOpcode() != AMDGPU::V_ACCVGPR_READ_B32_e64 &&
3460 MI.getOpcode() != AMDGPU::V_ACCVGPR_WRITE_B32_e64)
3462 auto IsVALUFn = [](
const MachineInstr &
MI) {
3466 return getWaitStatesSinceDef(
Reg, IsVALUFn, 2 ) <
3467 std::numeric_limits<int>::max();
3470 WaitStatesNeededForUse = VALUWriteAccVgprRdWrLdStDepVALUWaitStates -
3471 getWaitStatesSince(IsVALUAccVgprRdWrCheckFn, MaxWaitStates);
3472 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3475 return WaitStatesNeeded;
3478int GCNHazardRecognizer::checkPermlaneHazards(
MachineInstr *
MI)
const {
3479 assert(!ST.hasVcmpxPermlaneHazard() &&
3480 "this is a different vcmpx+permlane hazard");
3481 const SIRegisterInfo *TRI = ST.getRegisterInfo();
3482 const SIInstrInfo *TII = ST.getInstrInfo();
3484 auto IsVCmpXWritesExecFn = [TII, TRI](
const MachineInstr &
MI) {
3488 auto IsVALUFn = [](
const MachineInstr &
MI) {
3492 const int VCmpXWritesExecWaitStates = 4;
3493 const int VALUWritesVDstWaitStates = 2;
3494 int WaitStatesNeeded = 0;
3496 for (
const MachineOperand &
Op :
MI->explicit_uses()) {
3497 if (!
Op.isReg() || !TRI->isVGPR(MF.getRegInfo(),
Op.getReg()))
3501 int WaitStatesSinceDef =
3502 VALUWritesVDstWaitStates -
3503 getWaitStatesSinceDef(
Reg, IsVALUFn,
3504 VALUWritesVDstWaitStates);
3505 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesSinceDef);
3506 if (WaitStatesNeeded >= VALUWritesVDstWaitStates)
3510 int VCmpXHazardWaits =
3511 VCmpXWritesExecWaitStates -
3512 getWaitStatesSince(IsVCmpXWritesExecFn, VCmpXWritesExecWaitStates);
3514 WaitStatesNeeded = std::max(WaitStatesNeeded, VCmpXHazardWaits);
3515 return WaitStatesNeeded;
3523 return NumPasses + 2;
3533 return NumPasses + 3 + (NumPasses != 2 && IsGFX950);
3543 return NumPasses + 3 + (NumPasses != 2 && IsGFX950);
3551 return NumPasses + 2;
3554int GCNHazardRecognizer::checkMAIVALUHazards(
MachineInstr *
MI)
const {
3555 if (!ST.hasGFX90AInsts())
3558 auto IsDGEMMFn = [](
const MachineInstr &
MI) ->
bool {
3566 const MachineRegisterInfo &MRI = MF.getRegInfo();
3568 int WaitStatesNeeded = 0;
3574 const MachineInstr *
MFMA =
nullptr;
3576 auto IsMFMAWriteFn = [&
Reg, &
MFMA,
this](
const MachineInstr &
MI) {
3578 !TRI.regsOverlap(
MI.getOperand(0).getReg(),
Reg))
3584 const MachineInstr *
DOT =
nullptr;
3585 auto IsDotWriteFn = [&
Reg, &
DOT,
this](
const MachineInstr &
MI) {
3587 !TRI.regsOverlap(
MI.getOperand(0).getReg(),
Reg))
3593 bool DGEMMAfterVALUWrite =
false;
3594 auto IsDGEMMHazard = [&DGEMMAfterVALUWrite,
this](
const MachineInstr &
MI) {
3597 DGEMMAfterVALUWrite =
true;
3601 if (!TII.isVALU(
MI,
true) || !DGEMMAfterVALUWrite)
3607 int SrcCIdx = AMDGPU::getNamedOperandIdx(
MI->getOpcode(),
3608 AMDGPU::OpName::src2);
3610 if (IsMemOrExport || IsVALU) {
3611 const int SMFMA4x4WriteVgprVALUMemExpReadWaitStates = 5;
3612 const int SMFMA16x16WriteVgprVALUMemExpReadWaitStates = 11;
3613 const int SMFMA32x32WriteVgprVALUMemExpReadWaitStates = 19;
3614 const int DMFMA4x4WriteVgprMemExpReadWaitStates = 9;
3615 const int DMFMA16x16WriteVgprMemExpReadWaitStates = 18;
3616 const int DMFMA4x4WriteVgprVALUReadWaitStates = 6;
3617 const int DMFMA16x16WriteVgprVALUReadWaitStates = 11;
3618 const int GFX950_DMFMA16x16WriteVgprVALUReadWaitStates = 19;
3619 const int DotWriteSameDotReadSrcAB = 3;
3620 const int DotWriteDifferentVALURead = 3;
3621 const int DMFMABetweenVALUWriteVMEMRead = 2;
3622 const int MaxWaitStates = 19;
3624 for (
const MachineOperand &Use :
MI->explicit_uses()) {
3630 int WaitStatesSinceDef = getWaitStatesSinceDef(
Reg, IsDotWriteFn,
3633 int NeedWaitStates = 0;
3634 if (
DOT->getOpcode() ==
MI->getOpcode()) {
3635 if (&Use - &
MI->getOperand(0) != SrcCIdx)
3636 NeedWaitStates = DotWriteSameDotReadSrcAB;
3638 NeedWaitStates = DotWriteDifferentVALURead;
3641 int WaitStatesNeededForUse = NeedWaitStates - WaitStatesSinceDef;
3642 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3649 if (IsMem && ST.hasGFX90AInsts() && !ST.hasGFX940Insts()) {
3650 DGEMMAfterVALUWrite =
false;
3651 if (TRI.isVectorRegister(MRI,
Reg)) {
3652 int WaitStatesNeededForUse =
3653 DMFMABetweenVALUWriteVMEMRead -
3654 getWaitStatesSinceDef(
Reg, IsDGEMMHazard,
3655 DMFMABetweenVALUWriteVMEMRead);
3657 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3662 WaitStatesSinceDef =
3663 getWaitStatesSinceDef(
Reg, IsMFMAWriteFn, MaxWaitStates);
3667 unsigned HazardDefLatency = TSchedModel.computeInstrLatency(
MFMA);
3668 int NumPasses = HazardDefLatency;
3669 int NeedWaitStates = MaxWaitStates;
3672 switch (HazardDefLatency) {
3674 NeedWaitStates = IsMemOrExport ? DMFMA4x4WriteVgprMemExpReadWaitStates
3675 : DMFMA4x4WriteVgprVALUReadWaitStates;
3681 ? DMFMA16x16WriteVgprMemExpReadWaitStates
3682 : (ST.hasGFX950Insts()
3683 ? GFX950_DMFMA16x16WriteVgprVALUReadWaitStates
3684 : DMFMA16x16WriteVgprVALUReadWaitStates);
3689 }
else if (ST.hasGFX940Insts()) {
3693 NumPasses, ST.hasGFX950Insts())
3697 switch (HazardDefLatency) {
3699 NeedWaitStates = SMFMA4x4WriteVgprVALUMemExpReadWaitStates;
3702 NeedWaitStates = SMFMA16x16WriteVgprVALUMemExpReadWaitStates;
3705 NeedWaitStates = SMFMA32x32WriteVgprVALUMemExpReadWaitStates;
3712 int WaitStatesNeededForUse = NeedWaitStates - WaitStatesSinceDef;
3713 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3715 if (WaitStatesNeeded == MaxWaitStates)
3720 unsigned Opc =
MI->getOpcode();
3721 const int DMFMAToFMA64WaitStates = 2;
3722 if ((
Opc == AMDGPU::V_FMA_F64_e64 ||
3723 Opc == AMDGPU::V_FMAC_F64_e32 ||
Opc == AMDGPU::V_FMAC_F64_e64 ||
3724 Opc == AMDGPU::V_FMAC_F64_dpp) &&
3725 WaitStatesNeeded < DMFMAToFMA64WaitStates) {
3726 int WaitStatesNeededForUse = DMFMAToFMA64WaitStates -
3727 getWaitStatesSince(IsDGEMMFn, DMFMAToFMA64WaitStates);
3728 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3731 if (!IsVALU && !IsMemOrExport)
3732 return WaitStatesNeeded;
3734 for (
const MachineOperand &Def :
MI->defs()) {
3735 const int SMFMA4x4WriteVgprVALUWawWaitStates = 5;
3736 const int SMFMA16x16WriteVgprVALUWawWaitStates = 11;
3737 const int SMFMA32x32WriteVgprVALUWawWaitStates = 19;
3738 const int SMFMA4x4ReadVgprVALUWarWaitStates = 1;
3739 const int GFX940_XDL4PassReadVgprVALUWarWaitStates = 3;
3740 const int SMFMA16x16ReadVgprVALUWarWaitStates = 7;
3741 const int SMFMA32x32ReadVgprVALUWarWaitStates = 15;
3742 const int DMFMA4x4WriteVgprVALUWriteWaitStates = 6;
3743 const int DMFMA16x16WriteVgprVALUWriteWaitStates = 11;
3744 const int DotWriteDifferentVALUWrite = 3;
3745 const int MaxWaitStates = 19;
3746 const int MaxWarWaitStates = 15;
3751 int WaitStatesSinceDef = getWaitStatesSinceDef(
Reg, IsDotWriteFn,
3753 if (DOT &&
DOT->getOpcode() !=
MI->getOpcode())
3754 WaitStatesNeeded = std::max(WaitStatesNeeded, DotWriteDifferentVALUWrite -
3755 WaitStatesSinceDef);
3758 WaitStatesSinceDef =
3759 getWaitStatesSinceDef(
Reg, IsMFMAWriteFn, MaxWaitStates);
3761 int NeedWaitStates = MaxWaitStates;
3762 int NumPasses = TSchedModel.computeInstrLatency(
MFMA);
3765 switch (NumPasses) {
3767 NeedWaitStates = DMFMA4x4WriteVgprVALUWriteWaitStates;
3771 NeedWaitStates = DMFMA16x16WriteVgprVALUWriteWaitStates;
3776 }
else if (ST.hasGFX940Insts()) {
3780 NumPasses, ST.hasGFX950Insts())
3783 switch (NumPasses) {
3785 NeedWaitStates = SMFMA4x4WriteVgprVALUWawWaitStates;
3788 NeedWaitStates = SMFMA16x16WriteVgprVALUWawWaitStates;
3791 NeedWaitStates = SMFMA32x32WriteVgprVALUWawWaitStates;
3798 int WaitStatesNeededForUse = NeedWaitStates - WaitStatesSinceDef;
3799 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3801 if (WaitStatesNeeded == MaxWaitStates)
3805 auto IsSMFMAReadAsCFn = [&
Reg, &
MFMA,
this](
const MachineInstr &
MI) {
3807 !
MI.readsRegister(
Reg, &TRI))
3810 if (ST.hasGFX940Insts() && !TII.isXDL(
MI))
3813 const MachineOperand *SrcC =
3814 TII.getNamedOperand(
MI, AMDGPU::OpName::src2);
3824 int WaitStatesSinceUse = getWaitStatesSince(IsSMFMAReadAsCFn,
3829 unsigned HazardDefLatency = TSchedModel.computeInstrLatency(
MFMA);
3830 int NeedWaitStates = MaxWaitStates;
3831 switch (HazardDefLatency) {
3832 case 2: NeedWaitStates = SMFMA4x4ReadVgprVALUWarWaitStates;
3834 case 4:
assert(ST.hasGFX940Insts());
3835 NeedWaitStates = GFX940_XDL4PassReadVgprVALUWarWaitStates;
3837 case 8: NeedWaitStates = SMFMA16x16ReadVgprVALUWarWaitStates;
3839 case 16: [[fallthrough]];
3840 default: NeedWaitStates = SMFMA32x32ReadVgprVALUWarWaitStates;
3844 int WaitStatesNeededForUse = NeedWaitStates - WaitStatesSinceUse;
3845 WaitStatesNeeded = std::max(WaitStatesNeeded, WaitStatesNeededForUse);
3848 return WaitStatesNeeded;
3861 return MAI !=
nullptr;
3865 if (IsMFMAFn(*
MI)) {
3866 int W = getWaitStatesSince(IsMFMAFn, 16);
3868 return W < (int)TSchedModel.computeInstrLatency(MAI);
3882 while (
I->isBundledWithPred())
3888 if (
I->getOpcode() != AMDGPU::S_GETPC_B64)
3892 const unsigned NewBytes = 4;
3894 "Unexpected instruction insertion in bundle");
3897 while (NextMI != End && NextMI->isBundledWithPred()) {
3898 for (
auto &Operand : NextMI->operands()) {
3899 if (Operand.isGlobal())
3900 Operand.setOffset(Operand.getOffset() + NewBytes);
3906bool GCNHazardRecognizer::fixVALUMaskWriteHazard(
MachineInstr *
MI) {
3907 if (!ST.hasVALUMaskWriteHazard())
3909 assert(!ST.hasExtendedWaitCounts());
3916 if (!IsSALU && !IsVALU)
3928 const SIRegisterInfo *TRI = ST.getRegisterInfo();
3929 const MachineRegisterInfo &MRI = MF.getRegInfo();
3934 case AMDGPU::EXEC_LO:
3935 case AMDGPU::EXEC_HI:
3937 case AMDGPU::SGPR_NULL:
3938 case AMDGPU::SGPR_NULL64:
3946 return Reg == AMDGPU::VCC ||
Reg == AMDGPU::VCC_LO ||
Reg == AMDGPU::VCC_HI;
3950 SmallSet<Register, 2> HazardSGPRs;
3952 static unsigned getHashValue(
const StateType &State) {
3955 static bool isEqual(
const StateType &
LHS,
const StateType &
RHS) {
3956 return LHS.HazardSGPRs ==
RHS.HazardSGPRs;
3960 SmallVector<const MachineInstr *> WaitInstrs;
3961 StateType InitialState;
3964 MachineOperand *HazardDef =
nullptr;
3965 for (MachineOperand &
Op :
MI->all_defs()) {
3967 if (IgnoreableSGPR(
Reg))
3970 if (
Op.isImplicit())
3972 if (!TRI->isSGPRReg(MRI,
Reg))
3985 if (AMDGPU::SReg_32RegClass.
contains(HazardReg)) {
3986 InitialState.HazardSGPRs.insert(HazardReg);
3989 InitialState.HazardSGPRs.insert(TRI->getSubReg(HazardReg, AMDGPU::sub0));
3990 InitialState.HazardSGPRs.insert(TRI->getSubReg(HazardReg, AMDGPU::sub1));
3993 auto IsHazardFn = [&](StateType &State,
const MachineInstr &
I) {
3994 if (State.HazardSGPRs.empty())
3997 switch (
I.getOpcode()) {
3998 case AMDGPU::V_ADDC_U32_e32:
3999 case AMDGPU::V_ADDC_U32_dpp:
4000 case AMDGPU::V_CNDMASK_B16_t16_e32:
4001 case AMDGPU::V_CNDMASK_B16_fake16_e32:
4002 case AMDGPU::V_CNDMASK_B16_t16_dpp:
4003 case AMDGPU::V_CNDMASK_B16_fake16_dpp:
4004 case AMDGPU::V_CNDMASK_B32_e32:
4005 case AMDGPU::V_CNDMASK_B32_dpp:
4006 case AMDGPU::V_DIV_FMAS_F32_e64:
4007 case AMDGPU::V_DIV_FMAS_F64_e64:
4008 case AMDGPU::V_SUBB_U32_e32:
4009 case AMDGPU::V_SUBB_U32_dpp:
4010 case AMDGPU::V_SUBBREV_U32_e32:
4011 case AMDGPU::V_SUBBREV_U32_dpp: {
4015 case AMDGPU::V_ADDC_U32_e64:
4016 case AMDGPU::V_ADDC_U32_e64_dpp:
4017 case AMDGPU::V_CNDMASK_B16_t16_e64:
4018 case AMDGPU::V_CNDMASK_B16_fake16_e64:
4019 case AMDGPU::V_CNDMASK_B16_t16_e64_dpp:
4020 case AMDGPU::V_CNDMASK_B16_fake16_e64_dpp:
4021 case AMDGPU::V_CNDMASK_B32_e64:
4022 case AMDGPU::V_CNDMASK_B32_e64_dpp:
4023 case AMDGPU::V_SUBB_U32_e64:
4024 case AMDGPU::V_SUBB_U32_e64_dpp:
4025 case AMDGPU::V_SUBBREV_U32_e64:
4026 case AMDGPU::V_SUBBREV_U32_e64_dpp: {
4028 const MachineOperand *SSRCOp = TII.getNamedOperand(
I, AMDGPU::OpName::src2);
4030 bool Result = TRI->regsOverlap(SSRCOp->
getReg(), HazardReg);
4038 auto UpdateStateFn = [&](StateType &State,
const MachineInstr &
I) {
4040 for (
auto &
Op :
I.all_defs()) {
4042 if (IgnoreableSGPR(
Reg))
4045 if (
Op.isImplicit())
4047 if (!TRI->isSGPRReg(MRI,
Reg))
4054 for (
Register SGPR : State.HazardSGPRs) {
4055 if (
Reg == SGPR || TRI->regsOverlap(
Reg, SGPR))
4059 State.HazardSGPRs.erase(SGPR);
4066 std::next(
MI->getReverseIterator())))
4076 auto NextMI = std::next(
MI->getIterator());
4077 auto NewMI =
BuildMI(*
MI->getParent(), NextMI,
MI->getDebugLoc(),
4078 TII.get(AMDGPU::S_WAITCNT_DEPCTR))
4090 if (EntryMBB.
begin() != EntryMBB.
end()) {
4091 auto &EntryMI = *EntryMBB.
begin();
4092 if (EntryMI.getOpcode() == AMDGPU::S_SETPRIO &&
4093 EntryMI.getOperand(0).getImm() >= Priority)
4102bool GCNHazardRecognizer::fixRequiredExportPriority(
MachineInstr *
MI) {
4103 if (!ST.hasRequiredExportPriority())
4121 const int MaxPriority = 3;
4122 const int NormalPriority = 2;
4123 const int PostExportPriority = 0;
4125 auto It =
MI->getIterator();
4126 switch (
MI->getOpcode()) {
4127 case AMDGPU::S_ENDPGM:
4128 case AMDGPU::S_ENDPGM_SAVED:
4129 case AMDGPU::S_ENDPGM_ORDERED_PS_DONE:
4130 case AMDGPU::SI_RETURN_TO_EPILOG:
4133 if (MF->getFrameInfo().hasCalls())
4136 case AMDGPU::S_SETPRIO: {
4138 auto &PrioOp =
MI->getOperand(0);
4139 int Prio = PrioOp.getImm();
4140 bool InWA = (Prio == PostExportPriority) &&
4141 (It !=
MBB->
begin() && TII.isEXP(*std::prev(It)));
4142 if (InWA || Prio >= NormalPriority)
4144 PrioOp.setImm(std::min(Prio + NormalPriority, MaxPriority));
4148 if (!TII.isEXP(*
MI))
4159 auto NextMI = std::next(It);
4160 bool EndOfShader =
false;
4161 if (NextMI !=
MBB->
end()) {
4163 if (TII.isEXP(*NextMI))
4166 if (NextMI->getOpcode() == AMDGPU::S_SETPRIO &&
4167 NextMI->getOperand(0).getImm() == PostExportPriority)
4169 EndOfShader = NextMI->getOpcode() == AMDGPU::S_ENDPGM;
4176 .
addImm(PostExportPriority);
4180 BuildMI(*
MBB, NextMI,
DL, TII.get(AMDGPU::S_WAITCNT_EXPCNT))
4181 .
addReg(AMDGPU::SGPR_NULL)
4201 const SIInstrInfo *TII = ST.getInstrInfo();
4213 TII->get(AMDGPU::S_WAITCNT_DEPCTR))
4218bool GCNHazardRecognizer::fixDsAtomicAsyncBarrierArriveB64(
MachineInstr *
MI) {
4219 if (
MI->getOpcode() != AMDGPU::DS_ATOMIC_ASYNC_BARRIER_ARRIVE_B64)
4222 const SIInstrInfo *TII = ST.getInstrInfo();
4224 TII->get(AMDGPU::S_WAITCNT_DEPCTR))
4226 BuildMI(*
MI->getParent(), std::next(
MI->getIterator()),
MI->getDebugLoc(),
4227 TII->get(AMDGPU::S_WAITCNT_DEPCTR))
4233bool GCNHazardRecognizer::fixScratchBaseForwardingHazard(
MachineInstr *
MI) {
4239 const SIRegisterInfo *TRI = ST.getRegisterInfo();
4240 const SIInstrInfo *TII = ST.getInstrInfo();
4242 const int FlatScrBaseWaitStates = 10;
4244 bool ReadsFlatScrLo =
4246 bool ReadsFlatScrHi =
4247 MI->readsRegister(AMDGPU::SRC_FLAT_SCRATCH_BASE_HI, TRI);
4253 ReadsFlatScrLo =
true;
4256 ReadsFlatScrHi =
true;
4261 const MachineRegisterInfo &MRI = MF.getRegInfo();
4264 DenseSet<const MachineBasicBlock *> Visited;
4266 return MI.modifiesRegister(
Reg, TRI);
4271 auto IsSGPRDef = [TII, TRI, &MRI](
const MachineInstr &
MI) ->
unsigned {
4272 if (!TII->isSALU(
MI) && !TII->isVALU(
MI,
true))
4274 for (
const MachineOperand &MO :
MI.all_defs()) {
4275 if (TRI->isSGPRReg(MRI, MO.getReg()))
4281 auto IsExpiredFn = [=](
const MachineInstr &
MI,
int SgprWrites) {
4282 if (
MI.getOpcode() == AMDGPU::S_WAITCNT_DEPCTR) {
4283 unsigned Wait =
MI.getOperand(0).getImm();
4288 return SgprWrites >= FlatScrBaseWaitStates;
4291 return ::getWaitStatesSince(
4292 IsHazardFn,
MI->getParent(), std::next(
MI->getReverseIterator()),
4293 0,
IsExpiredFn, Visited, IsSGPRDef) < FlatScrBaseWaitStates;
4297 !IsRegDefHazard(AMDGPU::SGPR102)) &&
4299 !IsRegDefHazard(AMDGPU::SGPR103)))
4303 TII->get(AMDGPU::S_WAITCNT_DEPCTR))
4314 BuildMI(*
MI->getParent(),
MI,
MI->getDebugLoc(), TII.get(AMDGPU::V_NOP_e32));
4315 BuildMI(*
MI->getParent(),
MI,
MI->getDebugLoc(), TII.get(AMDGPU::V_NOP_e32));
4320 auto IsTDM = [&](
const MachineInstr &
MI) ->
bool {
4322 MI.getOpcode() != AMDGPU::S_WAIT_TENSORCNT;
4329 if (
MI.getOpcode() != AMDGPU::S_WAIT_TENSORCNT)
4331 return MI.getOperand(0).getImm() <= 10;
4335 std::numeric_limits<int>::max())
4339 TII.get(AMDGPU::S_WAIT_TENSORCNT))
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
AMDGPU Rewrite AGPR Copy MFMA
The AMDGPU TargetMachine interface definition for hw codegen targets.
MachineBasicBlock MachineBasicBlock::iterator DebugLoc DL
static bool isEqual(const Function &Caller, const Function &Callee)
static GCRegistry::Add< CoreCLRGC > E("coreclr", "CoreCLR-compatible GC")
static cl::opt< unsigned, false, MFMAPaddingRatioParser > MFMAPaddingRatio("amdgpu-mfma-padding-ratio", cl::init(0), cl::Hidden, cl::desc("Fill a percentage of the latency between " "neighboring MFMA with s_nops."))
static bool shouldRunLdsBranchVmemWARHazardFixup(const MachineFunction &MF, const GCNSubtarget &ST)
static cl::opt< bool > EnableWMMAVnopHoisting("amdgpu-wmma-vnop-hoisting", cl::init(true), cl::Hidden, cl::desc("Hoist WMMA hazard V_NOPs from loops to preheaders"))
static bool consumesDstSelForwardingOperand(const MachineInstr *VALU, const MachineOperand *Dst, const SIRegisterInfo *TRI)
Checks whether the provided MI "consumes" the operand with a Dest sel fowarding issue Dst .
static bool isSGetReg(unsigned Opcode)
static bool breaksSMEMSoftClause(MachineInstr *MI)
static bool isLdsDma(const MachineInstr &MI)
static int GFX940_XDL_N_PassWritesVGPROverlappedSrcABWaitStates(int NumPasses, bool IsGFX950)
static unsigned getWMMAHazardInstInCategory(const MachineInstr &MI, const SIInstrInfo *TII, const TargetSchedModel &SchedModel, const GCNSubtarget &ST)
static bool isRFE(unsigned Opcode)
static bool isRWLane(unsigned Opcode)
static bool isSMovRel(unsigned Opcode)
#define DEBUG_TYPE_VERBOSE
static const MachineOperand * getDstSelForwardingOperand(const MachineInstr &MI, const GCNSubtarget &ST)
Dest sel forwarding issue occurs if additional logic is needed to swizzle / pack the computed value i...
static int GFX940_XDL_N_PassWritesVGPROverlappedSGEMMDGEMMSrcCWaitStates(int NumPasses, bool IsGFX950)
static void updateGetPCBundle(MachineInstr *NewMI)
static int GFX940_XDL_N_PassWriteVgprVALUMemExpReadWaitStates(int NumPasses, bool IsGFX950)
static bool isStoreCountWaitZero(const MachineInstr &I)
static bool breaksVMEMSoftClause(MachineInstr *MI)
static bool isVCmpXWritesExec(const SIInstrInfo &TII, const SIRegisterInfo &TRI, const MachineInstr &MI)
static bool isSSetReg(unsigned Opcode)
static void addRegUnits(const SIRegisterInfo &TRI, BitVector &BV, MCRegister Reg)
static unsigned getHWReg(const SIInstrInfo *TII, const MachineInstr &RegInstr)
static bool isDivFMas(unsigned Opcode)
static bool hasHazard(StateT InitialState, function_ref< HazardFnResult(StateT &, const MachineInstr &)> IsHazard, function_ref< void(StateT &, const MachineInstr &)> UpdateState, const MachineBasicBlock *InitialMBB, MachineBasicBlock::const_reverse_instr_iterator InitialI)
static int getWaitStatesSince(GCNHazardRecognizer::IsHazardFn IsHazard, const MachineBasicBlock *MBB, MachineBasicBlock::const_reverse_instr_iterator I, int WaitStates, GCNHazardRecognizer::IsExpiredFn IsExpired, DenseSet< const MachineBasicBlock * > &Visited, GCNHazardRecognizer::GetNumWaitStatesFn GetNumWaitStates=SIInstrInfo::getNumWaitStates)
static int GFX940_SMFMA_N_PassWritesVGPROverlappedSrcABWaitStates(int NumPasses)
static int GFX940_XDL_N_PassWriteVgprVALUWawWaitStates(int NumPasses, bool IsGFX950)
static int GFX940_SMFMA_N_PassWriteVgprVALUMemExpReadWaitStates(int NumPasses)
static int GFX940_SMFMA_N_PassWritesVGPROverlappedSMFMASrcCWaitStates(int NumPasses)
static bool isCoexecutableVALUInst(const MachineInstr &MI)
static bool ensureEntrySetPrio(MachineFunction *MF, int Priority, const SIInstrInfo &TII)
static void addRegsToSet(const SIRegisterInfo &TRI, iterator_range< MachineInstr::const_mop_iterator > Ops, BitVector &DefSet, BitVector &UseSet)
static void insertNoopsInBundle(MachineInstr *MI, const SIInstrInfo &TII, unsigned Quantity)
static bool isSendMsgTraceDataOrGDS(const SIInstrInfo &TII, const MachineInstr &MI)
static cl::opt< unsigned > NopPadding("amdgpu-snop-padding", cl::init(0), cl::Hidden, cl::desc("Insert a s_nop x before every instruction"))
static bool isPermlane(const MachineInstr &MI)
static int GFX940_SMFMA_N_PassWriteVgprVALUWawWaitStates(int NumPasses)
static int GFX940_XDL_N_PassWritesVGPROverlappedXDLOrSMFMASrcCWaitStates(int NumPasses, bool IsGFX950)
AMD GCN specific subclass of TargetSubtarget.
static Register UseReg(const MachineOperand &MO)
const HexagonInstrInfo * TII
const AbstractManglingParser< Derived, Alloc >::OperatorInfo AbstractManglingParser< Derived, Alloc >::Ops[]
static llvm::Error parse(GsymDataExtractor &Data, uint64_t BaseAddr, LineEntryCallback const &Callback)
Register const TargetRegisterInfo * TRI
Promote Memory to Register
static MCRegister getReg(const MCDisassembler *D, unsigned RC, unsigned RegNo)
static bool contains(SmallPtrSetImpl< ConstantExpr * > &Cache, ConstantExpr *Expr, Constant *C)
This file defines the 'Statistic' class, which is designed to be an easy way to expose various metric...
#define STATISTIC(VARNAME, DESC)
#define DEBUG_WITH_TYPE(TYPE,...)
DEBUG_WITH_TYPE macro - This macro should be used by passes to emit debug information.
static const uint32_t IV[8]
unsigned get(InstCounterType T) const
BitVector & set()
Set all bits in the bitvector.
std::pair< iterator, bool > insert_as(std::pair< KeyT, ValueT > &&KV, const LookupKeyT &Val)
Alternate version of insert() which allows a different, and possibly less expensive,...
Implements a dense probed hash-table based set.
CallingConv::ID getCallingConv() const
getCallingConv()/setCallingConv(CC) - These method get and set the calling convention of this functio...
unsigned getHazardWaitStates(MachineInstr *MI) const
Returns the number of wait states until all hazards for MI are resolved.
unsigned PreEmitNoopsCommon(MachineInstr *) const
OperatingMode
Operating mode for the hazard recognizer.
void EmitNoop() override
EmitNoop - This callback is invoked when a noop was added to the instruction stream.
void Reset() override
Reset - This callback is invoked when a new block of instructions is about to be schedule.
unsigned PreEmitNoops(MachineInstr *) override
This overload will be used when the hazard recognizer is being used by a non-scheduling pass,...
void EmitInstruction(SUnit *SU) override
EmitInstruction - This callback is invoked when an instruction is emitted, to advance the hazard stat...
function_ref< bool(const MachineInstr &)> IsHazardFn
void AdvanceCycle() override
AdvanceCycle - This callback is invoked whenever the next top-down instruction to be scheduled cannot...
function_ref< unsigned int(const MachineInstr &)> GetNumWaitStatesFn
bool ShouldPreferAnother(SUnit *SU) const override
ShouldPreferAnother - This callback may be invoked if getHazardType returns NoHazard.
bool hasPhysRegs() const
Returns true if instruction operands are physical registers, so that hazards defined by register depe...
function_ref< bool(const MachineInstr &, int WaitStates)> IsExpiredFn
bool isSchedulerMode() const
Returns true if running as a scheduler (pre-RA or post-RA).
GCNHazardRecognizer(const MachineFunction &MF, OperatingMode Mode, MachineLoopInfo *MLI=nullptr)
Construct with explicit operating mode.
static AMDGPU::CoExecMaskT getCoExecMaskForMI(const MachineInstr &MI, const SIInstrInfo &TII)
Get the CoExecMask for a given instruction.
HazardType getHazardType(SUnit *SU, int Stalls) override
getHazardType - Return the hazard type of emitting this node.
void RecedeCycle() override
RecedeCycle - This callback is invoked whenever the next bottom-up instruction to be scheduled cannot...
bool isHazardRecognizerMode() const
Returns true if running as the standalone hazard recognizer pass.
bool isPreRA() const
Returns true if running in pre-RA scheduling mode.
BlockT * getLoopPreheader() const
If there is a preheader for this loop, return it.
LoopT * getParentLoop() const
Return the parent loop if it exists or nullptr for top level loops.
Wrapper class representing physical registers. Should be passed by value.
Instructions::const_reverse_iterator const_reverse_instr_iterator
LLVM_ABI iterator getFirstTerminator()
Returns an iterator to the first terminator instruction of this basic block.
Instructions::iterator instr_iterator
const MachineFunction * getParent() const
Return the MachineFunction containing this basic block.
MachineInstrBundleIterator< MachineInstr > iterator
Function & getFunction()
Return the LLVM function that this machine code represents.
const MachineBasicBlock & front() const
const MachineInstrBuilder & addReg(Register RegNo, RegState Flags={}, unsigned SubReg=0) const
Add a new virtual register operand.
const MachineInstrBuilder & addImm(int64_t Val) const
Add a new immediate operand.
const MachineInstrBuilder & add(const MachineOperand &MO) const
const MachineInstrBuilder & addDef(Register RegNo, RegState Flags={}, unsigned SubReg=0) const
Add a virtual register definition operand.
Representation of each machine instruction.
unsigned getOpcode() const
Returns the opcode of this MachineInstr.
const MachineBasicBlock * getParent() const
bool readsRegister(Register Reg, const TargetRegisterInfo *TRI) const
Return true if the MachineInstr reads the specified register.
bool isBundled() const
Return true if this instruction part of a bundle.
MachineOperand class - Representation of each machine instruction operand.
void setImm(int64_t immVal)
bool isReg() const
isReg - Tests if this is a MO_Register operand.
LLVM_ABI void setReg(Register Reg)
Change the register this operand corresponds to.
void setIsKill(bool Val=true)
void setIsUndef(bool Val=true)
Register getReg() const
getReg - Returns the register number.
MachineRegisterInfo - Keep track of information for virtual and physical registers,...
LLVM_ABI bool isConstantPhysReg(MCRegister PhysReg) const
Returns true if PhysReg is unallocatable and constant throughout the function.
LLVM_ABI bool isPhysRegUsed(MCRegister PhysReg, bool SkipRegMaskTest=false) const
Return true if the specified register is modified or read in this function.
Wrapper class representing virtual and physical registers.
static bool isDS(const MachineInstr &MI)
static bool isVMEM(const MachineInstr &MI)
static bool isSMRD(const MachineInstr &MI)
static bool isMTBUF(const MachineInstr &MI)
static bool isDGEMM(unsigned Opcode)
static bool isEXP(const MachineInstr &MI)
static bool isSALU(const MachineInstr &MI)
static bool isSDWA(const MachineInstr &MI)
static bool isDOT(const MachineInstr &MI)
static bool usesTENSOR_CNT(const MachineInstr &MI)
static bool isSWMMAC(const MachineInstr &MI)
static bool isLDSDIR(const MachineInstr &MI)
static bool isVALU(const MachineInstr &MI, bool AllowLDSDMA)
static bool isTRANS(const MachineInstr &MI)
static bool isMUBUF(const MachineInstr &MI)
static bool isWaitcnt(unsigned Opcode)
static bool isDPP(const MachineInstr &MI)
static bool isMFMA(const MachineInstr &MI)
static bool isMAI(const MCInstrDesc &Desc)
static bool isFPAtomic(const MachineInstr &MI)
static bool isMIMG(const MachineInstr &MI)
static unsigned getNumWaitStates(const MachineInstr &MI)
Return the number of wait states that result from executing this instruction.
static bool isWMMA(const MachineInstr &MI)
static bool isFLAT(const MachineInstr &MI)
static bool isLDSDMA(const MachineInstr &MI)
unsigned getOccupancy() const
Scheduling unit. This is a node in the scheduling DAG.
bool isInstr() const
Returns true if this SUnit refers to a machine instruction as opposed to an SDNode.
MachineInstr * getInstr() const
Returns the representative MachineInstr for this SUnit.
unsigned getMaxLookAhead() const
unsigned MaxLookAhead
MaxLookAhead - Indicate the number of cycles in the scoreboard state.
virtual void EmitNoops(unsigned Quantity)
EmitNoops - This callback is invoked when noops were added to the instruction stream.
size_type size() const
Determine the number of elements in the SetVector.
bool insert(const value_type &X)
Insert a new element into the SetVector.
A SetVector that performs no allocations if smaller than a certain size.
std::pair< const_iterator, bool > insert(const T &V)
insert - Insert an element into the set if it isn't already there.
This class consists of common code factored out of the SmallVector class to reduce code duplication b...
reference emplace_back(ArgTypes &&... Args)
void push_back(const T &Elt)
This is a 'vector' (really, a variable-sized array), optimized for the case when the array is small.
bool getAsInteger(unsigned Radix, T &Result) const
Parse the current string as an integer of the specified radix.
Provide an instruction scheduling machine model to CodeGen passes.
std::pair< iterator, bool > insert(const ValueT &V)
An efficient, type-erasing, non-owning reference to a callable.
self_iterator getIterator()
A range adaptor for a pair of iterators.
#define llvm_unreachable(msg)
Marks that the current location is not supposed to be reachable.
unsigned encodeFieldVaVcc(unsigned Encoded, unsigned VaVcc)
unsigned encodeFieldVaVdst(unsigned Encoded, unsigned VaVdst)
unsigned decodeFieldSaSdst(unsigned Encoded)
unsigned decodeFieldVaSdst(unsigned Encoded)
unsigned encodeFieldVmVsrc(unsigned Encoded, unsigned VmVsrc)
unsigned encodeFieldSaSdst(unsigned Encoded, unsigned SaSdst)
unsigned decodeFieldVaVdst(unsigned Encoded)
unsigned decodeFieldVmVsrc(unsigned Encoded)
unsigned encodeFieldVaSdst(unsigned Encoded, unsigned VaSdst)
const char * getCoExecMaskName(CoExecMaskT Mask)
Return a human-readable name for a mask holding a single instruction class, as produced by getCoExecM...
LLVM_READONLY const MIMGInfo * getMIMGInfo(unsigned Opc)
StringRef getSchedStrategy(const Function &F)
constexpr unsigned MaxCoExecStages
Max stages: INT8 16x16x64 = 17 cycles, round up for safety.
FPType getFPDstSelType(unsigned Opc)
bool isGFX12Plus(const MCSubtargetInfo &STI)
const char * getStageTypeName(CoExecStageType T)
LLVM_ABI IsaVersion getIsaVersion(StringRef GPU)
unsigned getRegBitWidth(unsigned RCID)
Get the size in bits of a register from the register class RC.
Waitcnt decodeWaitcnt(const IsaVersion &Version, unsigned Encoded)
CoExecInfo getCoExecInfo(const MachineInstr &MI, const SIInstrInfo &TII)
Get co-execution info for a WMMA instruction, selecting the per-cycle slot pattern from the opcode (a...
LLVM_READONLY bool hasNamedOperand(uint64_t Opcode, OpName NamedIdx)
InstructionFlavor classifyFlavor(const MachineInstr &MI, const SIInstrInfo &SII)
Classify MI into the execution flavor that drives both the scheduler's slot preferences and the hazar...
constexpr CoExecMaskT getCoExecMask(InstructionFlavor F)
Map a flavor to the co-execution class it occupies in a window slot.
bool isGFX1250(const MCSubtargetInfo &STI)
@ AMDGPU_CS
Used for Mesa/AMDPAL compute shaders.
@ AMDGPU_KERNEL
Used for AMDGPU code object kernels.
@ AMDGPU_Gfx
Used for AMD graphics targets.
@ AMDGPU_CS_ChainPreserve
Used on AMDGPUs to give the middle-end more control over argument placement.
@ AMDGPU_CS_Chain
Used on AMDGPUs to give the middle-end more control over argument placement.
This namespace contains all of the command line option processing machinery.
initializer< Ty > init(const Ty &Val)
NodeAddr< DefNode * > Def
NodeAddr< UseNode * > Use
This is an optimization pass for GlobalISel generic memory operations.
auto drop_begin(T &&RangeOrContainer, size_t N=1)
Return a range covering RangeOrContainer with the first N elements excluded.
MachineInstrBuilder BuildMI(MachineFunction &MF, const MIMetadata &MIMD, const MCInstrDesc &MCID)
Builder interface. Specify how to create the initial instruction itself.
@ Kill
The last use of a register.
@ Undef
Value of the register doesn't matter.
@ Define
Register definition.
constexpr RegState getDeadRegState(bool B)
RelativeUniformCounterPtr ValuesPtrExpr VTableAddr Value
LLVM_ABI raw_ostream & dbgs()
dbgs() - This returns a reference to a raw_ostream for debugging messages.
class LLVM_GSL_OWNER SmallVector
Forward declaration of SmallVector so that calculateSmallVectorDefaultInlinedElements can reference s...
LLVM_ATTRIBUTE_VISIBILITY_DEFAULT AnalysisKey InnerAnalysisManagerProxy< AnalysisManagerT, IRUnitT, ExtraArgTs... >::Key
RelativeUniformCounterPtr ValuesPtrExpr VTableAddr Count
DWARFExpression::Operation Op
RelativeUniformCounterPtr ValuesPtrExpr VTableAddr Next
hash_code hash_combine(const Ts &...args)
Combine values into a single hash_code.
LLVM_ABI Printable printMBBReference(const MachineBasicBlock &MBB)
Prints a machine basic block reference.
hash_code hash_combine_range(InputIteratorT first, InputIteratorT last)
Compute a hash_code for a sequence of values.
Co-execution characteristics for a multi-cycle instruction.
static std::tuple< typename Fields::ValueType... > decode(uint64_t Encoded)
An information struct used to provide DenseMap with the various necessary components for a given valu...