20#include "llvm/IR/IntrinsicsAMDGPU.h"
24#define DEBUG_TYPE "amdgpu-lower-intrinsics"
30class AMDGPULowerIntrinsicsImpl {
46class AMDGPULowerIntrinsicsLegacy :
public ModulePass {
50 AMDGPULowerIntrinsicsLegacy() :
ModulePass(ID) {}
52 bool runOnModule(
Module &M)
override;
68bool AMDGPULowerIntrinsicsImpl::run() {
72 switch (
F.getIntrinsicID()) {
75 case Intrinsic::amdgcn_s_barrier:
76 case Intrinsic::amdgcn_s_barrier_signal:
77 case Intrinsic::amdgcn_s_barrier_signal_isfirst:
78 case Intrinsic::amdgcn_s_barrier_wait:
79 case Intrinsic::amdgcn_s_cluster_barrier:
82 case Intrinsic::amdgcn_ptr_s_buffer_load:
84 F, [&](IntrinsicInst *
II) {
Changed |= visitPtrSBufferLoad(*
II); });
86 case Intrinsic::amdgcn_s_monitor_sleep:
88 F, [&](IntrinsicInst *
II) {
Changed |= visitMonitorSleep(*
II); });
98bool AMDGPULowerIntrinsicsImpl::visitBarrier(IntrinsicInst &
I) {
99 assert(
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier ||
100 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal ||
101 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal_isfirst ||
102 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_wait ||
103 I.getIntrinsicID() == Intrinsic::amdgcn_s_cluster_barrier);
105 const GCNSubtarget &
ST = TM.
getSubtarget<GCNSubtarget>(*
I.getFunction());
106 bool IsSingleWaveWG =
false;
109 unsigned WGMaxSize =
ST.getFlatWorkGroupSizes(*
I.getFunction()).second;
110 IsSingleWaveWG = WGMaxSize <=
ST.getWavefrontSize();
117 if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_cluster_barrier) {
120 if (IsSingleWaveWG) {
121 B.CreateIntrinsicWithoutFolding(
B.getVoidTy(),
122 Intrinsic::amdgcn_wave_barrier, {})
127 CallInst *IsFirst =
B.CreateIntrinsicWithoutFolding(
128 B.getInt1Ty(), Intrinsic::amdgcn_s_barrier_signal_isfirst,
131 B.CreateIntrinsicWithoutFolding(
132 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_wait, {BarrierID_16})
137 B.SetInsertPoint(ThenTerm);
144 B.CreateIntrinsicWithoutFolding(
145 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_signal, {BarrierID_32})
148 B.SetInsertPoint(&
I);
149 B.CreateIntrinsicWithoutFolding(
150 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_wait, {BarrierID_16})
157 bool IsWorkgroupScope =
false;
159 if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_wait ||
160 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal ||
161 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal_isfirst) {
167 IsWorkgroupScope =
true;
168 else if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal_isfirst &&
170 I.getContext().diagnose(
171 DiagnosticInfoUnsupported(*
I.getFunction(),
172 "s_barrier_signal_isfirst does not support "
173 "user_cluster_barrier_id (-3)",
177 assert(
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier);
178 IsWorkgroupScope =
true;
181 if (IsWorkgroupScope && IsSingleWaveWG) {
183 if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier ||
184 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_wait) {
185 B.CreateIntrinsicWithoutFolding(
B.getVoidTy(),
186 Intrinsic::amdgcn_wave_barrier, {})
188 }
else if (
I.getIntrinsicID() ==
189 Intrinsic::amdgcn_s_barrier_signal_isfirst) {
191 I.replaceAllUsesWith(
B.getInt1(
true));
197 if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier &&
198 ST.hasSplitBarriers()) {
202 B.CreateIntrinsicWithoutFolding(
203 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_signal, {BarrierID_32})
205 B.CreateIntrinsicWithoutFolding(
206 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_wait, {BarrierID_16})
215bool AMDGPULowerIntrinsicsImpl::visitPtrSBufferLoad(IntrinsicInst &
I) {
216 assert(
I.getIntrinsicID() == Intrinsic::amdgcn_ptr_s_buffer_load);
218 if (
I.hasMetadata(LLVMContext::MD_invariant_load))
221 I.setMetadata(LLVMContext::MD_invariant_load,
226bool AMDGPULowerIntrinsicsImpl::visitMonitorSleep(IntrinsicInst &
I) {
227 assert(
I.getIntrinsicID() == Intrinsic::amdgcn_s_monitor_sleep);
229 const GCNSubtarget &
ST = TM.
getSubtarget<GCNSubtarget>(*
I.getFunction());
230 if (!
ST.hasNoSleepForever())
234 if (!(Sleep & 0x8000))
238 Value *NewSleep =
B.getInt16(0x2000);
239 I.setArgOperand(0, NewSleep);
246 AMDGPULowerIntrinsicsImpl Impl(M, TM);
252bool AMDGPULowerIntrinsicsLegacy::runOnModule(
Module &M) {
253 auto &TPC = getAnalysis<TargetPassConfig>();
256 AMDGPULowerIntrinsicsImpl Impl(M, TM);
260#define PASS_DESC "AMDGPU lower intrinsics"
267char AMDGPULowerIntrinsicsLegacy::ID = 0;
270 return new AMDGPULowerIntrinsicsLegacy;
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
The AMDGPU TargetMachine interface definition for hw codegen targets.
static GCRegistry::Add< OcamlGC > B("ocaml", "ocaml 3.10-compatible GC")
AMD GCN specific subclass of TargetSubtarget.
uint64_t IntrinsicInst * II
ModuleAnalysisManager MAM
#define INITIALIZE_PASS_DEPENDENCY(depName)
#define INITIALIZE_PASS_END(passName, arg, name, cfg, analysis)
#define INITIALIZE_PASS_BEGIN(passName, arg, name, cfg, analysis)
static bool forEachCall(Function &Intrin, T Callback)
Represent the analysis usage information of a pass.
AnalysisUsage & addRequired()
LLVM_ABI void copyMetadata(const Instruction &SrcInst, ArrayRef< unsigned > WL=ArrayRef< unsigned >())
Copy metadata from SrcInst to this instruction.
A wrapper class for inspecting calls to intrinsic functions.
static MDTuple * get(LLVMContext &Context, ArrayRef< Metadata * > MDs)
ModulePass class - This class is used to implement unstructured interprocedural optimizations and ana...
A Module instance is used to store all the information related to an LLVM module.
A set of analyses that are preserved following a run of a transformation pass.
static PreservedAnalyses none()
Convenience factory function for the empty preserved set.
static PreservedAnalyses all()
Construct a special preserved set that preserves all passes.
CodeGenOptLevel getOptLevel() const
Returns the optimization level: None, Less, Default, or Aggressive.
const STC & getSubtarget(const Function &F) const
This method returns a pointer to the specified type of TargetSubtargetInfo.
Target-Independent Code Generator Pass Configuration Options.
iterator_range< user_iterator > users()
friend class Instruction
Iterator for Instructions in a `BasicBlock.
This is an optimization pass for GlobalISel generic memory operations.
decltype(auto) dyn_cast(const From &Val)
dyn_cast<X> - Return the argument parameter cast to the specified type.
iterator_range< early_inc_iterator_impl< detail::IterOfRange< RangeT > > > make_early_inc_range(RangeT &&Range)
Make a range that does early increment to allow mutation of the underlying range without disrupting i...
RelativeUniformCounterPtr ValuesPtrExpr VTableAddr Value
ModulePass * createAMDGPULowerIntrinsicsLegacyPass()
IRBuilder(LLVMContext &, FolderTy, InserterTy, MDNode *, ArrayRef< OperandBundleDef >) -> IRBuilder< FolderTy, InserterTy >
decltype(auto) cast(const From &Val)
cast<X> - Return the argument parameter cast to the specified type.
LLVM_ABI Instruction * SplitBlockAndInsertIfThen(Value *Cond, BasicBlock::iterator SplitBefore, bool Unreachable, MDNode *BranchWeights=nullptr, DomTreeUpdater *DTU=nullptr, LoopInfo *LI=nullptr, BasicBlock *ThenBlock=nullptr)
Split the containing block at the specified instruction - everything before SplitBefore stays in the ...
AnalysisManager< Module > ModuleAnalysisManager
Convenience typedef for the Module analysis manager.
PreservedAnalyses run(Module &M, ModuleAnalysisManager &MAM)