26#define DEBUG_TYPE "si-post-ra-16bit-mov-folding"
30class SIPostRA16BitMovFolding {
37 MCRegister &SrcReg32,
bool &SrcIsHi,
bool &SrcIsImm,
38 int64_t &ImmVal)
const;
41 bool IsHiFirst)
const;
55 return "SI post-RA 16bit Mov Folding";
64 return SIPostRA16BitMovFolding().run(MF);
71 "SI Post RA 16bit Mov Folding",
false,
false)
73char SIPostRA16BitMovFoldingLegacy::ID = 0;
80void SIPostRA16BitMovFolding::getMovB16Info(
82 bool &SrcIsVGPR,
MCRegister &SrcReg32,
bool &SrcIsHi,
bool &SrcIsImm,
83 int64_t &ImmVal)
const {
99 SrcIsVGPR = AMDGPU::VGPR_16RegClass.contains(SrcReg16);
102 SrcReg32 =
TRI->get32BitRegister(SrcReg16);
122bool SIPostRA16BitMovFolding::mergeSingleMovB16Pair(
MachineInstr &
Lo,
124 bool IsHiFirst)
const {
126 MCRegister LoDst =
Lo.getOperand(0).getReg().asMCReg();
127 MCRegister HiDst =
Hi.getOperand(0).getReg().asMCReg();
128 MCRegister Dst32 =
TRI->get32BitRegister(LoDst);
131 MCRegister LoSrc16, LoSrc32, HiSrc16, HiSrc32;
132 bool LoSrcIsHi, HiSrcIsHi, LoSrcIsImm, HiSrcIsImm, LoSrcIsVGPR, HiSrcIsVGPR;
133 int64_t LoImm = 0, HiImm = 0;
135 getMovB16Info(
Lo,
TRI, LoSrc16, LoSrcIsVGPR, LoSrc32, LoSrcIsHi, LoSrcIsImm,
137 getMovB16Info(
Hi,
TRI, HiSrc16, HiSrcIsVGPR, HiSrc32, HiSrcIsHi, HiSrcIsImm,
140 MachineInstr &FirstMI = IsHiFirst ?
Hi :
Lo;
141 MachineInstr &SecondMI = IsHiFirst ?
Lo :
Hi;
146 unsigned LoopCnt = 0, UpperBoundCnt = UINT_MAX, LowerBoundCnt = 0;
155 MCRegister FirstSrc16 = IsHiFirst ? HiSrc16 : LoSrc16;
156 MCRegister FirstDst16 = IsHiFirst ? HiDst : LoDst;
157 MCRegister SecondSrc16 = IsHiFirst ? LoSrc16 : HiSrc16;
158 MCRegister SecondDst16 = IsHiFirst ? LoDst : HiDst;
159 for (MachineInstr &Scan :
161 if (Scan.isDebugInstr())
163 if (Scan.modifiesRegister(Dst32,
TRI))
165 assert(!Scan.modifiesRegister(AMDGPU::EXEC,
TRI) &&
166 "Expect no write on EXEC!");
168 if (LoopCnt < UpperBoundCnt &&
169 ((FirstSrc16 && Scan.modifiesRegister(FirstSrc16,
TRI)) ||
170 Scan.readsRegister(FirstDst16,
TRI))) {
171 UpperBound = Scan.getIterator();
172 UpperBoundCnt = LoopCnt;
174 if (LoopCnt > LowerBoundCnt &&
175 ((SecondSrc16 && Scan.modifiesRegister(SecondSrc16,
TRI)) ||
176 Scan.readsRegister(SecondDst16,
TRI))) {
178 LowerBoundCnt = LoopCnt;
183 if (LowerBoundCnt >= UpperBoundCnt)
188 MachineInstr &Selected = *UpperBound;
196 if (!HiSrcIsImm && !LoSrcIsImm) {
198 if (!LoSrcIsVGPR && !HiSrcIsVGPR && HiSrc32 != LoSrc32)
200 unsigned MaskHiSrc = HiSrcIsHi ? 0x0706 : 0x0504;
201 unsigned MaskLoSrc = LoSrcIsHi ? 0x0302 : 0x0100;
205 .
addImm((MaskHiSrc << 16) | MaskLoSrc);
206 Lo.eraseFromParent();
207 Hi.eraseFromParent();
212 AMDGPU::VGPR_32_Lo128RegClass.contains(Dst32) &&
214 (LoSrcIsVGPR && AMDGPU::VGPR_32_Lo128RegClass.contains(LoSrc32))) &&
216 (HiSrcIsVGPR && AMDGPU::VGPR_32_Lo128RegClass.contains(HiSrc32)));
220 if (HiSrcIsImm && HiImm == 0 && !LoSrcIsImm && !LoSrcIsHi) {
222 TII->get(Usevop2 ? AMDGPU::V_AND_B32_e32 : AMDGPU::V_AND_B32_e64),
226 Lo.eraseFromParent();
227 Hi.eraseFromParent();
233 if (HiSrcIsImm && HiImm == 0 && !LoSrcIsImm && LoSrcIsHi) {
235 TII->get(Usevop2 ? AMDGPU::V_LSHRREV_B32_e32
236 : AMDGPU::V_LSHRREV_B32_e64),
240 Lo.eraseFromParent();
241 Hi.eraseFromParent();
247 if (LoSrcIsImm && LoImm == 0 && !HiSrcIsImm && !HiSrcIsHi) {
249 TII->get(Usevop2 ? AMDGPU::V_LSHLREV_B32_e32
250 : AMDGPU::V_LSHLREV_B32_e64),
254 Lo.eraseFromParent();
255 Hi.eraseFromParent();
261 if (LoSrcIsImm && LoImm == 0 && !HiSrcIsImm && HiSrcIsHi) {
263 TII->get(Usevop2 ? AMDGPU::V_AND_B32_e32 : AMDGPU::V_AND_B32_e64),
267 Lo.eraseFromParent();
268 Hi.eraseFromParent();
277bool SIPostRA16BitMovFolding::mergeMovB16Pairs(
MachineFunction &MF)
const {
279 for (MachineBasicBlock &
MBB : MF) {
289 const unsigned ScanLimit = 16;
290 std::array<Pending, ScanLimit> CirBuf = {};
291 SmallDenseMap<MCRegister, unsigned> PendingWrites;
295 if (
MI.isDebugInstr())
298 unsigned Opc =
MI.getOpcode();
299 bool IsMovB16 = (
Opc == AMDGPU::V_MOV_B16_t16_e32 ||
300 Opc == AMDGPU::V_MOV_B16_t16_e64);
302 if (++Head == ScanLimit)
306 PendingWrites.
erase(CirBuf[Head].Dst32);
309 CirBuf[Head] = {MCRegister(),
nullptr,
false};
314 MCRegister DstReg =
MI.getOperand(0).getReg().asMCReg();
316 MCRegister Dst32 =
TRI->get32BitRegister(DstReg);
319 CirBuf[Head] = {Dst32, &
MI, DstIsHi};
323 if (CirBuf[It->second].IsHi == DstIsHi) {
329 MachineInstr &LoMI = !DstIsHi ?
MI : *CirBuf[It->second].MI;
330 MachineInstr &HiMI = DstIsHi ?
MI : *CirBuf[It->second].MI;
331 bool IsHiFirst = CirBuf[It->second].IsHi;
332 if (mergeSingleMovB16Pair(LoMI, HiMI, IsHiFirst)) {
334 PendingWrites.
erase(It);
348 SIPostRA16BitMovFolding().run(MF);
355 TII = ST.getInstrInfo();
359 if (ST.useRealTrue16Insts())
360 Changed |= mergeMovB16Pairs(MF);
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
Provides AMDGPU specific target descriptions.
MachineBasicBlock MachineBasicBlock::iterator DebugLoc DL
AMD GCN specific subclass of TargetSubtarget.
const HexagonInstrInfo * TII
Register const TargetRegisterInfo * TRI
#define INITIALIZE_PASS(passName, arg, name, cfg, analysis)
This file implements a set that has insertion order iteration characteristics.
Represent the analysis usage information of a pass.
void setPreservesAll()
Set by analyses that do not transform their input at all.
bool erase(const KeyT &Val)
std::pair< iterator, bool > insert(const std::pair< KeyT, ValueT > &KV)
Wrapper class representing physical registers. Should be passed by value.
const MachineFunction * getParent() const
Return the MachineFunction containing this basic block.
MachineInstrBundleIterator< MachineInstr > iterator
MachineFunctionPass - This class adapts the FunctionPass interface to allow convenient creation of pa...
void getAnalysisUsage(AnalysisUsage &AU) const override
getAnalysisUsage - Subclasses that override getAnalysisUsage must call this.
const TargetSubtargetInfo & getSubtarget() const
getSubtarget - Return the subtarget for which this machine code is being compiled.
const MachineInstrBuilder & addReg(Register RegNo, RegState Flags={}, unsigned SubReg=0) const
Add a new virtual register operand.
const MachineInstrBuilder & addImm(int64_t Val) const
Add a new immediate operand.
Representation of each machine instruction.
const DebugLoc & getDebugLoc() const
Returns the debug location id of this MachineInstr.
MachineOperand class - Representation of each machine instruction operand.
static PreservedAnalyses all()
Construct a special preserved set that preserves all passes.
MCRegister asMCReg() const
Utility to check-convert this value to a MCRegister.
PreservedAnalyses run(MachineFunction &MF, MachineFunctionAnalysisManager &MFAM)
Represent a constant reference to a string, i.e.
self_iterator getIterator()
bool isHi16Reg(MCRegister Reg, const MCRegisterInfo &MRI)
This is an optimization pass for GlobalISel generic memory operations.
auto drop_begin(T &&RangeOrContainer, size_t N=1)
Return a range covering RangeOrContainer with the first N elements excluded.
MachineInstrBuilder BuildMI(MachineFunction &MF, const MIMetadata &MIMD, const MCInstrDesc &MCID)
Builder interface. Specify how to create the initial instruction itself.
iterator_range< T > make_range(T x, T y)
Convenience function for iterating over sub-ranges.
iterator_range< early_inc_iterator_impl< detail::IterOfRange< RangeT > > > make_early_inc_range(RangeT &&Range)
Make a range that does early increment to allow mutation of the underlying range without disrupting i...
AnalysisManager< MachineFunction > MachineFunctionAnalysisManager
char & SIPostRA16BitMovFoldingLegacyID
LLVM_ABI raw_ostream & dbgs()
dbgs() - This returns a reference to a raw_ostream for debugging messages.