SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions
来自IPADS的文章。这篇文章把ARM里的矩阵加速器SME用在CPU LLM Serving上。SME是ARM提出的一个加速装置,功能类似Intel的AMX加速器(AMX类似GPU里的TensorCore) Modern CPUs increasingly integrate matrix extensions, such as Arm Scalable Matrix Extension (SME
WIP 《悉达多》
悉达多确曾识得许多德高望重的婆罗门,尤其是他的父亲,那纯净的、博学的、最值得敬仰的父亲。他的父亲确实令人钦佩:其举止沉稳而高贵,其生活洁净如水,言语中蕴含智慧,额际间闪耀着细腻而高尚的思绪。然而,即便是这般通达之人,是否真正得享极乐?是否真已安于内心的和平?他是否也仍只是个探寻者,仍是一个灵魂干渴之人?他是否仍需一次次来到圣泉之前,如饥似渴地吮饮?仍需依靠祭祀、经典,以及婆罗门的辩论之言以解心中之
- Books Reading
- Haibin
- 2026-08-14
- 153 Views
- 0 Comments
A Survey for White-Box Feature Mining in LLMs’ Hallucination Detection
White-Box Feature Mining for Hallucination Detection in Large Language Models This post is adapted from my CS306 Data Mining course report. The original PDF version is available here: data_mining_pers
WIP: 禅与摩托车的维修艺术
最近我感觉自己精神虚无。打游戏从之前的调味剂变成生活后,我开始迷失自我。在AI、同辈压力等等事情交杂中,我需要重新慢下来,深度思考一段时间。 《禅与摩托车》:内心宁静与心流 - 好好笑先生的文章 - 知乎 https://zhuanlan.zhihu.com/p/19816425
- Books Reading
- Haibin
- 2026-08-10
- 137 Views
- 0 Comments
Learning how to detect AI-generated text: use RAID benchmarks as an example
RAID Benchmark: Multi-Generator Detection & Adversarial Robustness Analysis 数据挖掘方面的小项目。最核心的idea是,AI生成的文本短小,且喜欢概括核心思想。检测的主要办法是再用AI跑,看困惑度。 final report: https://github.com/HaibinLai/HC3/blob/main/re
0805 after PPoPP
8点投完稿,9点吃了炒饭,10点开会。现在4点36分,躺在床上完全睡不着。 投完这篇PPoPP,哪怕依旧没有中,也意味着我本科最后一份工作的结束。 对这份工作满意吗?从论文最后的数据结果看,还不错。我几乎用上了毕生所学,写作和实验时如同和机器在跳一支久违的双人舞。似乎没什么不满意的,可能唯一的就是做了它一年多快两年。但是久功磨一剑,终于站在了风口下。 现在什么心情呢?有解脱,迷茫,一种高三过去的感
Agent 时代下的工程
我在之前这篇文章里讲述了我如何与AI协作完成2000行的作业: https://haibin-blog.vercel.app/index.php/%e6%80%8e%e4%b9%88%e7%94%a8ai%e5%86%992000%e8%a1%8c%e7%9a%84%e5%a4%a7%e4%bd%9c%e4%b8%9a/ 然而时代变迁,从25年11月到26年3月,Agent的生产力已经远远超乎我的想
图个数问题与burnside引理
问题 一个图G(V,E),如果有8个顶点,一共有多少个这样的图? 这个问题涉及到一个有趣的burnside引理,今天我们借这个问题来学习下这个图论引理。 不考虑同构情况 在这种情况下,我们假设每个顶点和边都有id,也就是他们是独一无二的。 如果默认是无向简单图,也就是: 顶点已经固定为 8 个; 没有自环; 两个顶点之间最多一条边; 边没有方向。 那么 8 个顶点之间最多有 \\binom{8}{2
或许我确实应该出去走走
前些天我一直在思考AI与人类的不同。我提出了一个观点:AI是梯度下降训练来的,而人类是一年年成长的,人类的读笔和文字会evolving,而AI不太会这样。但这样只是说明“AI和人类的制备方法不同”,我并没有证明两者化学性质不一致。 后来我思考到,AI和人类在目前大部分接近。但是评估智能的维度很多,AI只是部分拟合了人类的功能,比如代码、推理能力,另外有很多部分还没有很好的拟合。比如长上下文的能力,
今天我的vscode又离职了一位agent
今天我的vscode又离职了一位agent。在这么多agent里,读日志agent离开的是最多的。他们的输入和thinking都很繁重,还要从前辈的文档里记住以往的修改,并从日志里找出程序的端倪。我还经常把修复工作外包给他们,因为只有他们最懂项目发生了什么,是他们稳稳地接住了程序。有的agent活着,改的仓库一地鸡毛。有的agent死了,它的context被后人抬的很高很高
做研究真正的放假时刻是meeting完的后一秒
我说做研究,真正的放假时刻是meeting完的后一秒有没有懂的。急头白脸的对着自己拿copilot+matplotlib画的狗屎汗流浃背地挤出单字,说话速度堪比卡壳的GPT。比“那你这周什么也没做”更震耳欲聋的是全员的鸦雀无声,老板停止思考,组员放弃大脑,直到最后那句“那就下周继续吧”,下一秒退会议室退的比单排0-16-0都快。 我记得去年申请时,我需要搜集每个学校的信息,都要自己一个个点。 现在
接下来的blog写什么好
我对我的博客进行了浏览数据挖掘和分析,并且把最重要的博客交给了AI阅读。我发现AI给我的反馈很死板并且很无聊,我从而意识到我应该多加入一些有生活气息的博客内容,他们应该文字不多图片多短平快显示我的生活状态。接着我把这个需求交给了AI,它来制作一个新的板块。经过探索我认为应该做一个类似微信朋友圈的模块,然后我就可以在博客发朋友圈。 但是为什么要在博客发朋友圈而不是在微信发朋友圈呢,我觉得这样可以展示
Airport 95: Automated Baggage System?
Paper Link https://dl.acm.org/doi/pdf/10.1145/227531.227544 一篇1996年的老文章。作为课程学习阅读。 这篇文章《Airport 95: Automated Baggage System?》由 A. John Swartz 撰写,主要分析了丹佛国际机场(DIA)自动行李处理系统的失败案例。文章以该项目为研究对象,探讨了大型软件/系统工程中
OS与硬件的交互:TLB
我: 我已经知道了 OS 里的物理地址和虚拟地址。那难道每次我进行内存访问,都要进行一次转换吗? GPT: 是的,从概念上说,每次内存访问都需要把虚拟地址翻译成物理地址。但这不是每次都由操作系统慢慢查表完成,而主要由硬件完成。CPU 里有一个叫 TLB 的缓存,它保存最近用过的地址翻译结果。如果 TLB 命中,虚拟地址可以很快转换成物理地址;如果 TLB miss,硬件才会去查 page tabl
从零开始造一颗 RISC-V CPU(六):微架构验证体系与 IPC 性能评估
从零开始造一颗 RISC-V CPU(六):微架构验证体系与 IPC 性能评估报告 系列博客第 6 篇(最终篇) —— 在现代 CPU 设计中,验证(Verification)往往占据了流片前 70% 的工作量。本文将全面解析我们如何通过 Python 构建指令集模拟器(ISS)、约束随机验证(CRV)以及端到端的状态机快照比对,验证这套复杂的双发乱序引擎,并给出最终的微架构 IPC 性能跑分。
- Architecture
- Haibin
- 2026-06-07
- 355 Views
- 0 Comments
