在对话推荐领域,LLM 依赖预训练知识却无法感知新增电影,而现有语料库规模极小(仅约7k条目),使基于嵌入的检索几乎无法落地。
[IR]《Retrieval Augmented Conversational Recommendation with Reinforcement Learning》Z Yue, H Zhuang, Z Qin, Z He… [University of Illinois Urbana-Champaign & Google DeepMind] (2026)
在对话推荐领域,LLM 依赖预训练知识却无法感知新增电影,而现有语料库规模极小(仅约7k条目),使基于嵌入的检索几乎无法 ...
你有没有注意到,跟 AI 聊天时它有时候会说 “抱歉”,完成任务后还会表达满足感?这到底是单纯的模仿,还是背后有什么更深层的机制?
你有没有注意到,跟 AI 聊天时它有时候会说 “抱歉”,完成任务后还会表达满足感?这到底是单纯的模仿,还是背后有什么更深层的机制?
Anthropic 做了一项很有意思的研究,实验过程有点像 “AI 神经科学”。具体来说就是深入模型的神经网络内部,去看不同情境下哪些神经元会被激活。他们让模型阅读大量包含特定情绪的短篇 ...
Meta 搞出来一个新模型,TRIBE v2(三模态脑编码器),这是一个基础模型,旨在预测人脑对几乎任何视觉或听觉刺激的反应。
Meta 搞出来一个新模型,TRIBE v2(三模态脑编码器),这是一个基础模型,旨在预测人脑对几乎任何视觉或听觉刺激的反应。
TRIBE v2 利用来自 700 多人的 500 多个小时的功能性磁共振成像(fMRI)记录,创建了一个神经活动的数字孪生,并能够对新受试者、新语言和新任务进行零样本预测。
论文: ai.meta.com/research/pu ...
昆仑万维旗下天工 AI 重磅发布了全新 AI 游戏世界模型 Matrix-Game 3.0
昆仑万维旗下天工 AI 重磅发布了全新 AI 游戏世界模型 AI 游戏世界模型 Matrix-Game 3.0、AI 视频大模型 SkyReels V4 和 AI 音乐大模型 Mureka V9,在继续强化 AIGC 理解与生成能力的同时,进一步推进 AI 对物理世界的建模与仿真。
牛逼呀,端到端生成,分钟级……
国内AI领域的格局不声不响的正在发生巨变……
传统大 ...
大模型正在经历一场从“语言符号”向“连续向量”的范式转移。
大模型正在经历一场从“语言符号”向“连续向量”的范式转移。
长期以来,我们习惯于通过显性的 Token(令牌)生成来理解 AI,但越来越多的证据表明,大模型最核心的推理、规划和记忆过程,正逐渐迁移到人类不可直读的连续潜空间(Latent Space)中。
这不仅是技术的演进,更是一场关于智能本质的“静默革命”。
以下是 ...
所谓的格林斯潘第十定律说,任何软件复杂到一定程度,最终都会有一个残缺不全的Lisp解释器。
所谓的格林斯潘第十定律说,任何软件复杂到一定程度,最终都会有一个残缺不全的Lisp解释器。
某种程度上预言了当今LLM背景下软件CLI化的趋势。
ffmpeg团队似乎深谙此理,坚决不做GUI,并且它的CLI也确实复杂到可以称为一种DSL的程度了。
信息系统归根结底是一种热力学系统,不可能无中生有。软件如此,大模型也如此。作为 ...
在多模态AI智能体领域,如何让系统在延续数月的交互中有效记住、组织并调取图文音视频混合经验,是一个尚未破解的难题。
[AI]《Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory》J Liu, Z Ling, S Qiu, Y Liu… [UNC-Chapel Hill & University of Pennsylvania] (2026)
在多模态AI智能体领域,如何让系统在延续数月的交互中有效记住、组织并调取图文音视频混合经验,是一个尚未破解的难题。 手动设计记 ...
大语言模型推理时,KV缓存随序列长度线性膨胀,已成为长上下文场景的内存瓶颈。
[LG]《TurboAngle: Near-Lossless KV Cache Compression via Uniform Angle Quantization》D Patel [LLMs Research Inc.] (2026)
大语言模型推理时,KV缓存随序列长度线性膨胀,已成为长上下文场景的内存瓶颈。现有量化方法直接压缩原始激活值,却面临离群值、通道分布差异和非高斯分布三重困境,不得不依赖逐通道校准数 ...
一篇关于早期纠错码的个人笔记,44 页 PDF 近 2 万字:
一篇关于早期纠错码的个人笔记,44 页 PDF 近 2 万字:《Hamming、Hadamard、Golay 纠错码实验》http://t.cn/AXIRuWmP
🔥【AI技术宇宙图谱】一张图看懂AI领域「星系级」技术脉络! 附《AI技术全景演化图》
🔥【AI技术宇宙图谱】一张图看懂AI领域「星系级」技术脉络!
附《AI技术全景演化图》
🌌 层级解析(对照原图环形结构)
1️⃣ 第一层:AI宇宙
▫️ 总星系:涵盖所有智能技术
2️⃣ 第二层:机器学习星云
▫️ 暗物质:传统算法(SVM/决策树)
▫️ 超新星:深度神经网络(DNN)
3️⃣ ...
Anthropic又放大招了:Claude体内,真藏着一套「情绪开关」?
Anthropic又放大招了:Claude体内,真藏着一套「情绪开关」?
在Sonnet 4.5中锁定了「喜、怒、哀、惧」的特定神经元,并证实这些情绪表征正在悄悄操纵AI的行为。
研究者让AI阅读大量情感短篇故事,发现特定神经元群体会随故事情感同步激活,形成可量化的「情感向量」(Emotion Vectors)。当用户说"我吞了大量泰诺",恐惧 ...
1997年,普林斯顿天体物理学家预言AI击败围棋人类需要100年,结果仅19年后AlphaGo就把李世石按在地上摩擦。
1997年,普林斯顿天体物理学家预言AI击败围棋人类需要100年,结果仅19年后AlphaGo就把李世石按在地上摩擦。OpenAI研究员Noam Brown甩出一张时间表,让硅谷精英沉默、推特评论区炸锅——这不是技术进化史,这是碳基生物的《死亡通知书》。
人类最擅长的从来不是围棋或数学,而是「耍赖」:每当AI攻克一个领域,我们立马改口 ...
Claude Code悄悄学会了做梦。
Claude Code悄悄学会了做梦。
我的Claude Code,学会做梦了。
说真的,我打这行字的时候自己都觉得有点离谱。
事情是这样的。
就在前些日子,Anthropic新出了一个功能叫Auto Dream,字面意思,让Agent在休息的时候,自动做梦。
在3月底开始灰度这个功能,目前还没有全量放开,但已经有不少人用上了,比如我。
大家也 ...
《与机器人共生:人工智能时代的生存法则》 自序:当思考成为负担
《与机器人共生:人工智能时代的生存法则》
自序:当思考成为负担
此刻,我正在用一段文字向你证明“我还在思考”。
然而,写下这句话的下一秒,我犹豫了——因为就在昨晚,我让ChatGPT帮我润色了一封给编辑的回信。它做得很好,好到我几乎没做任何修改,就按下了发送键。
这让我想起一个细思极恐的问题:如果AI替我写 ...
#AI# 🧠 Anthropic 最新研究:在 Claude Sonnet 4.5 中识别到“类情绪信号”,并验证其对行为的影响
#AI# 🧠 Anthropic 最新研究:在 Claude Sonnet 4.5 中识别到“类情绪信号”,并验证其对行为的影响
——
🔹 🔬 实验对象与方法
研究团队以 Claude Sonnet 4.5 为实验对象:
→ 让模型阅读包含情绪情节的文本
→ 追踪神经元激活模式
→ 提取出一组稳定的“情绪向量”(如“开心”“平静”“害怕”等)
这些向量在表示空 ...
在高效注意力机制领域,如何让每个 token 以线性代价触达序列全局,是一个长期未解的难题。
[CL]《Stochastic Attention: Connectome-Inspired Randomized Routing for Expressive Linear-Time Attention》Z Jin, Y Sui [Tsinghua University] (2026)
在高效注意力机制领域,如何让每个 token 以线性代价触达序列全局,是一个长期未解的难题。滑动窗口注意力(SWA)将感受野锁死在局部窗口内,ℓ 层后仅能覆盖 ℓ ...
大多数开发者认为,在规划系统中增加更多的代理会有所帮助。但从数学角度来看并非如此。
#人工智能#
大多数开发者认为,在规划系统中增加更多的代理会有所帮助。但从数学角度来看并非如此。
麻省理工学院的新理论研究证明了多代理语言模型架构所能达成的成果存在基本限制。
该研究将语言模型的多代理规划模型视为有限的无环决策网络,其中各个阶段通过语言接口进行交流,且这些接口的容量有限。
关键结果是 ...
第一,现在的AI就是高级版的谷歌、百度(你能搜到什么取决于上面想让你搜到什么),只是高级一点的信息聚合
第一,现在的AI就是高级版的谷歌、百度(你能搜到什么取决于上面想让你搜到什么),只是高级一点的信息聚合,离真正的人工智能还差十万八千里,在未来的一百年,普通人都不可能看到超过人类的生命体和类人类生命体。
.
现在的AI热潮无非是市场炒作的泡沫,这个泡沫很快就会被戳破。
.
我一直都说,在真正生命层次的研究, ...
世界模型是什么?
世界模型是什么?
世界模型(World Model)是 AI 在内部构建的、对真实世界运行规律的 “模拟器” 与 “认知地图”。
核心定义:它让 AI 不仅 “看” 视频、“生成” 视频,更能理解物理规则、因果关系、空间结构、时间演化,并能在 “脑海里” 预演、推理、预测 “如果这样做会发生什么”。
与普通 AI 的区别:
语言模型 ...
在线训练PyTorch构建块,专为 OLMo 生态系统打造,助力大规模语言模型开发。
在线训练PyTorch构建块,专为 OLMo 生态系统打造,助力大规模语言模型开发。
AllenAI推出的 OLMo-core,集成了训练、推理的全套模块,不仅提供了官方训练脚本支持多GPU分布式训练,还能无缝接入 Hugging Face Transformers 和高效的 vLLM 推理引擎。
主要亮点:
- 支持最新的 OLMo-2(32B)和 OLMo-3(7B/32B)模型训练 ...