来自IPADS的文章。这篇文章把ARM里的矩阵加速器SME用在CPU LLM Serving上。SME是ARM提出的一个加速装置,功能类似Intel的AMX加速器(AMX类似GPU里的TensorCore) Modern CPUs increasingly integrate matrix extensions, such as Arm Scalable Matrix Extension (SME
White-Box Feature Mining for Hallucination Detection in Large Language Models This post is adapted from my CS306 Data Mining course report. The original PDF version is available here: data_mining_pers
5月份我曾经让Claude Opus 4.7自己做一个CPU。在当时我以为做一个5级流水线CPU是它的极限,没想到Opus在3轮对话下就完成了RV32I 5级流水线的实现和测试,完美完成了大二的计组project。 于是我就让它在后台慢慢跑了200轮交互,并且分析了它的日志。Opus先后完成了更多级的流水线、多发射、乱序执行、分支预测、多级缓存。我按照每个turn里agent做的主要工作,将tur