🔥 HN 热议

利用AI里的“0”省空间:BITCOS让三值模型低于1.58比特

约3分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
三值LLM

只用−1、0、+1三种数的大语言模型。

BITCOS

利用0的多寡来减少保存空间的方法。

比特

电脑用来表示信息的小单位。

发生了什么

Intel(制造处理器等芯片的公司)的三位研究者,在2026年9月14日把一篇论文放到了arXiv(公开研究论文的网站)上。论文研究一种更省空间的三值LLM(使用三种数字的大语言模型)。他们把新方法叫作BITCOS。

三值LLM里的每个权重,只使用−1、0、+1三种数。论文标题说它突破了1.58比特的门槛,但这不是一条不可改变的自然规律。约1.585比特来自log₂3。这个数假设三种符号出现得一样多。

背景:1.58比特从哪里来

权重是模型内部用来计算的小数字。每个权重占用的空间越少,模型文件就越小。模型生成答案时,也要不断从内存读取权重。因此,少读一些数据,有时能让生成更快。

常见做法是把5个三值数字装进1个字节。这样接近1.585比特。不过,实际模型常按128个权重分组。128不能被5整除,所以边界会留下空位,实际使用量会上升到1.625比特。

研究者测量了29个三值模型检查点。它们的0占比从29.7%到51.5%不等。也就是说,很多模型里的0比另外两个数更常见。这个偏差就是BITCOS可以利用的地方。

BITCOS怎样工作

BITCOS把数据分成两部分。第一部分是存在图。它为每个权重写一个比特,说明这个位置是不是0。第二部分是压紧的符号串。它只为非0权重保存正号或负号。

如果0的比例是z,那么每个权重需要1加上1−z,也就是2−z比特。0占51.5%时,计算是2−0.515=1.485比特。论文显示,在测试的29个模型中,有26个比5个三值数字装进1字节的做法更省空间。

BITCOS不需要重新训练模型,也不改变原来的三值。它只是换了保存和读取的方法。研究者还为AVX-512、AVX2和Intel Xe2 GPU写了读取代码。

实验结果说明了什么

研究者把BITCOS接入vLLM,并测试7个模型检查点。他们用了5个平台,包括64核服务器CPU、24核客户端CPU、8核客户端CPU、集成GPU和独立GPU。

当内存读数据是主要瓶颈时,BITCOS通常更快。64核CPU上的最终生成速度提高了1.10到1.18倍。24核CPU提高了1.02到1.15倍。集成GPU提高了1.09到1.22倍。独立GPU提高了1.02到1.27倍。

但结果并不适用于所有机器。在8核的Lunar Lake CPU上,BITCOS比2比特基准更慢。原因是读取小数据时,还要付出额外的还原计算。存得更小,不一定就答得更快。

已确认与仍未知的部分

论文给出了29个模型的0占比、保存量计算、底层测试和完整生成测试。这篇论文也在Hacker News(技术新闻社区)上受到关注。不过,Hacker News的points和comments只表示社区关注度,不是论文正确的证明。

论文目前是arXiv预印本,不等于已经成为行业标准。其他团队还要用不同芯片和软件复现结果。研究重点是保存空间和生成速度,不是证明三值模型的回答质量更高。模型本身的质量仍取决于训练方法。

接下来观察什么

接下来要看其他厂商的芯片能否得到相同收益,主流推理软件是否会支持BITCOS,以及真实设备的耗电量是否会下降。如果三值LLM继续发展,怎样读取和搬运权重,可能和怎样训练模型一样重要。

来源:arXiv论文、Hacker News讨论。

💬 关于打破三值LLM“1.58比特壁垒”的HN评论

评论围绕三值权重的log2(3)基准、利用零值偏多进一步压缩、硬件和内存带宽收益,以及保持准确率的难度展开。以下数值、性能和无损性的说法都来自评论者的解释、担忧或推测,未在此独立验证。

  • 如果每个权重只有−1、0、+1三种状态,那么均匀三选一的信息量是log2(3)≈1.58比特。因此,有评论者认为说“1.58比特”比说“1个trit”更容易理解。
  • 一位评论者解释说,如果真实模型中约51%的权重是0,那么通过更好的编码,平均值可能从1.58降到每个权重1.48比特。这是评论中的说法,并非此处独立核实的结果。
  • 如果硬件能直接处理三值权重,每个权重就可以表示“加、减或不操作”。评论者认为这可能有利于CPU、边缘设备或ASIC。另一位评论者说,在推理受内存带宽限制时,少读取数据也可能带来加速。这些都是评论者的预期或自述。
  • 反对意见认为,在PTQ(训练后量化)中,向量量化、trellis方法,或FLUTE这类高效GEMM内核可能达到相近效果。如果只是用码本把模型还原成FP16,主要节省的可能是存储和网络传输,而不是计算本身。
  • 准确率仍没有共识。评论者区分了QAT或低比特训练与PTQ;有人认为QAT有助于保准确率,也有人警告训练会更难或效率更低,而且不能保证无损。一位评论者称,即使是小分组的dynamic FP4,也不是在所有基准测试上都无损。
  • 另一个反驳是,使用4个存储比特,并不自动意味着保留了4比特的有用模型信息;分组的尺度和范围、裁剪、离群值,以及哪些权重更重要都会影响结果。评论还留下一个问题:压缩数据是否必须在内存中展开,例如每字节放5个trit;即使展开,减少读取量是否仍能缓解带宽瓶颈,也没有定论。

这是评论数为21时的初期(修订1)。获取21条,并从整体抽取21条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

让AI少占一点地方的新办法

📰 完整报道: 利用AI里的“0”省空间:BITCOS让三值模型低于1.58比特

Intel研究者发现,利用AI里很多的0,可以减少保存空间。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
三值LLM

只用三种数字的文字AI。

BITCOS

利用很多0来节省空间的方法。

比特

电脑保存信息的小单位。

💡 一句话总结

  • 有些AI数字可以装得更小。
  • 0越多,越容易节省空间。
  • 能不能变快,要看机器种类。

Intel(制造电脑芯片的公司)研究了一种三值LLM(三种数字组成的文字AI)。论文已经放在arXiv上。

三值LLM的权重只有三种数。它们是−1、0和+1。权重是AI内部用来计算的小数字。AI会用这些数字生成答案。

以前的保存方法,把三种数看得差不多一样。每个权重大约需要1.58比特。比特是电脑保存信息的小单位。

研究者检查了29个模型。有些模型里的0接近一半。最多的模型有51.5%的权重是0。

于是,研究者做了BITCOS(利用0来省空间的保存方法)。它先记录每个位置是不是0。只有不是0时,才记录它是正数还是负数。

0占51.5%时,计算是2−0.515=1.485比特。论文说,29个模型里有26个比原来的装法更省空间。

研究者在5个平台上做了测试。平台包括服务器CPU、普通电脑CPU、集成GPU和独立GPU。

有些机器因此生成得更快。64核CPU最高快到1.18倍。独立GPU最高快到1.27倍。

可是,8核的Lunar Lake反而变慢了。机器需要花更多时间,把小数据还原成可计算的数字。

这说明,保存空间变小,不一定让AI更快。

这篇论文也在Hacker News(技术新闻社区)上受到关注。关注度只说明很多人看到了它。它不能证明论文一定正确。

论文还没有说明AI回答得更好。其他团队也需要用不同机器继续测试。

来源:arXiv论文。

💬 简单理解:三值LLM能变得多小、多快?

评论的重点不只是“模型可能更小”,还包括“速度和准确率的取舍仍在争论”。这里的数字和性能说法来自评论者,并不是已经确认的结论。

  • 只用−1、0、+1三种权重值时,三选一的理论基准约为1.58比特。
  • 一位评论者说,如果约51%的权重是0,更聪明的打包方式可能达到每个权重1.48比特。这是评论中的未验证说法。
  • 如果机器直接使用三值权重,每个权重就表示“加、减或不做”。评论者认为这可能帮助CPU、小型设备和ASIC;从内存读取更少数据也可能有助于加速。
  • 另一方认为,对于训练后量化,向量量化、trellis量化和高效GEMM内核可能同样好。如果最后还原成FP16,主要收益可能只是文件更小、传输更省。
  • QAT会在低精度条件下训练,可能更容易保住准确率,但训练会更难,而且不能保证完全无损。有评论者说,小分组dynamic FP4在所有测试上也并非无损。
  • 即使存储用了4比特,也不代表4比特的有用信息都保留下来;离群值和分组尺度会影响结果。压缩权重是否要在内存中展开,以及少读数据是否仍能缓解带宽限制,也还没有定论。

这是评论数为21时的初期(修订1)。获取21条,并从整体抽取21条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

AI的数字盒子变小了

📰 完整报道: 利用AI里的“0”省空间:BITCOS让三值模型低于1.58比特

Intel研究者找到了一种少占地方的AI数字保存法。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
三值LLM

会写文字、只用三种数字的AI。

BITCOS

让AI数字盒子变小的方法。

Intel是一家做电脑零件的公司。

它的研究者研究了三值LLM。

三值LLM是会写文字的AI。

它里面有许多小数字。

这些数字有三种样子。

它们是−1、0和+1。

研究者发现,很多数字是0。

于是,他们做了BITCOS。

BITCOS是一种小小的保存方法。

它先记住哪里是0。

不是0的数字,才多记一个正负号。

这样,数字盒子可以小一些。

有些机器因此更快。

也有机器因此更慢。

因为它要多做一步读取工作。

这篇论文也在Hacker News上被许多人看到。

Hacker News是讨论电脑新闻的地方。

很多人看到,不等于一定正确。

其他人还要继续试验。

来源:研究论文。

💬 给五岁孩子:用三种符号做一个小AI

大家在问:AI能不能变小,同时还保持聪明?这些数字和速度想法来自评论者的解释和猜测。

  • AI给每个权重三个符号选一个:减、零或加。三个选择大约需要1.58个普通比特。
  • 有人说,因为大约51%的符号是零,它们也许能被挤得更紧,每个只用1.48比特。这还没有在这里得到确认。
  • 如果机器直接使用这三个符号,它们就表示“加一点”“减一点”或“什么也不做”。小机器也许会更快,但别的压缩办法也可能一样好。
  • AI变小后,也可能丢掉有用的细节。特别的训练也许能帮忙,但难处理的权重仍可能带来麻烦。压缩后的符号是否要在机器里展开,以及少读数据是否真的更快,大家还在讨论。

这是评论数为21时的初期(修订1)。获取21条,并从整体抽取21条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源