自研推理芯片工具链的重构,主要是网络层算子到自定义中间语言的转化、中间语言到底层硬件指令的Code Gen以及部分图级别优化pass的实现;基于LLVM框架的自研训练芯片编译器的开发及验证,主要是访存优化、Tensor Core相关API的支持等;申请相关专利4篇
1. 常见以及部分长尾算子在自研推理芯片上的中间IR生成、Code Gen,片上SRAM空间受限下神经网络算子的自动切分
2. 在LLVM框架中添加自研S2训练芯片的后端,包括寄存器定义、指令描述、指令选择、函数调用、编译优化等
3. 在Clang中添加自研S2训练芯片的高级语言扩展,主要是Intrinsic函数、内嵌汇编、device数学函数库的支持
4. 基于软件仿真器对编译器进行算子级测试和验证,并及时反馈仿真器的Bug、更新和维护编译器的测试用例