还有点脑神经宇宙的感觉。🧐
很有艺术潜力的一个项目,通过将查询特定文字的高维嵌入向量做可视化,来显示语义概念如何映射,还有点脑神经宇宙的感觉。🧐
{Project Golem: Neural Memory Visualizer + Project Golem:神经记忆可视化工具}
🧐Project Golem 是一款专为 RAG(检索增强生成)设计的 3D 神经记忆可视化工具,它利用 UMAP 技术将高维向量嵌 ...
一篇关于 2026 年前沿大模型训练方法论 的深度技术长文
一篇关于 2026 年前沿大模型训练方法论 的深度技术长文
djdumpling.github.io/2026/01/31/frontier_training.html
作者是耶鲁大学的Alex Wa
“实验室如何训练一个前沿的、多亿参数模型?我们关注七个开放权重的前沿模型:Hugging Face的SmolLM3、Prime Intellect的Intellect 3、Nous Research的Hermes 4、OpenAI的gpt-oss- ...
为什么在大型语言模型的表征空间里,月份会排列成完美的圆环,年份会延伸成平滑的直线,而地理坐标可以被线性解码?
[LG]《Symmetry in language statistics shapes the geometry of model representations》D Karkada, D J. Korchinski, A Nava, M Wyart... [Google DeepMind & UC Berkeley & EPFL] (2026)
为什么在大型语言模型的表征空间里,月份会排列成完美的圆环,年份会延伸成平滑的直线,而地理坐标可以被线性解码?这种几何结构 ...
从 vibe coding agent 到后训练,从零开始的实验科学
从 vibe coding agent 到后训练,从零开始的实验科学
http://t.cn/AXtl2TsV
这篇文章记录了作者 Vibe Coding一个投资Agent到利用后训练技术对其进行优化的实验过程。作者详述了使用 verl 框架对7B模型进行监督微调(SFT)和强化学习(RL)训练的经历,指出SFT虽然提升了工具使用能力但损害了推理能力。最终,通过采用GRPO ...
Claude模型在后端开发领域表现乏力,相较GPT系列明显逊色;尤其与GPT-5对比时,技术落差尤为显著。
Claude模型在后端开发领域表现乏力,相较GPT系列明显逊色;尤其与GPT-5对比时,技术落差尤为显著。 # claude http://t.cn/AXtLFRz1
🔍【深入解析Agentic RAG系统:单智能体 vs 多智能体架构】✨
🔍【深入解析Agentic RAG系统:单智能体 vs 多智能体架构】✨
——AI/ML/数据工程师必看!
💡Agentic RAG系统通过AI智能体优化信息检索与知识合成,是下一代AI应用的核心技术!
其架构可分为两大类👇
🤖【单智能体Agentic RAG】
▪️集中式决策:单一智能体掌控查询评估、知识源选择、数据整合与响应生成
▪️支持 ...
新人帖
53个AI模型的洗车悖论:为什么智能越高,常识反而越稀缺
【53个AI模型的洗车悖论:为什么智能越高,常识反而越稀缺】
一个简单到不能再简单的问题:洗车店就在50米外,我该走路去还是开车去?正确答案显而易见——必须开车,因为车本身得到洗车店才能洗。但测试53个主流AI模型后,结果让人瞠目结舌:只有11个答对了。
最荒诞的是Perplexity的sonar系列。它确实选择了“开车”, ...
长文档处理,ChatGPT 已成往事。
长文档处理,ChatGPT 已成往事。
Gemini Pro 可一次性读取多达 1,500 页内容,且不遗漏任何细节。
以下8 个用户分析合同,研究论文和报告的提示词,建议收藏。
1、合同风险与红线扫描器
你是一位资深公司律师。在回答之前请进行深度思考。所有回答必须严格基于上传的文件。在每一条结论后,请在 [方括号] 内引用确切的 ...
货架空了,还是钥匙丢了?本文为大模型的“幻觉”与“事实错误”提供了一个极具启发性的新视角:Recall Is the Bottleneck。
[CL]《Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality》N Calderon, E Ben-David, Z Gekhman, E Ofek... [Google Research & Technion] (2026)
货架空了,还是钥匙丢了?本文为大模型的“幻觉”与“事实错误”提供了一个极具启发性的新视角:Recall Is the Bottleneck。
过去我们总 ...
当AI不再“只是预测下一个词”:技术本质与认知边界的深度思考
【当AI不再“只是预测下一个词”:技术本质与认知边界的深度思考】
最近一篇关于AI能力边界的文章引发了广泛讨论,核心问题是:现代大语言模型是否已经超越了“预测下一个词”的本质?这场争论触及了我们理解AI的根本方式。
+ 机制层面:核心未变,外壳在变
从技术机制上看,LLM确实仍在做“下一个词预测”——这是自回 ...
这是一篇关于 ORBIT 框架的深度技术解读推文,旨在探讨如何通过跨回合元强化学习(Meta-RL)突破大语言模型在在线决策上的瓶颈。
[LG]《Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL》X Lin, S Zhu, Y Chen, M Chen... [Boston University & LinkedIn] (2026)
这是一篇关于 ORBIT 框架的深度技术解读推文,旨在探讨如何通过跨回合元强化学习(Meta-RL)突破大语言模型在在线决策上的瓶颈。
+ 从“静态智能”到 ...
左脚踩右脚,螺旋升天啦!
这个项目把大模型训练过程中的知识点都总结成了skill
github.com/Orchestra-Research/AI-Research-SKILLs
也就是理论上以后可以让Agent自己训练大模型,左脚踩右脚,螺旋升天啦!
#HOW I AI#
WebMcp致力于推动网站的第二受众用户:AI Agent也是网站的"一等公民"(人类是网站第一受众用户)
WebMcp致力于推动网站的第二受众用户:AI Agent也是网站的"一等公民"(人类是网站第一受众用户),是由Google 和 Microsoft 联合推动的 W3C 标准提案,已在chrome 146预览版支持
过去:以往我们让 AI Agent"帮我订行程机票和酒店",得像人一样操作,通过多模态视觉模型截图且理解整个网页,像盲人一样摸索网页——截屏看 ...
如果不给大模型指定任务和话题,只给个中性的开头(如 “Actually,” “Let’s think step by step,” ),让模型自由思考,会发
如果不给大模型指定任务和话题,只给个中性的开头(如 “Actually,” “Let’s think step by step,” ),让模型自由思考,会发生什么?
together ai做了这项蛮有意思的研究。
GPT-OSS 更容易谈论编程和数学,两者加起来超过输出的一半;
Llama 更偏文学和叙事性文本,技术内容相对少;
DeepSeek 生成宗教相关内容的比例 ...
Anthropic 和 OpenAI 最近先后发布了各自的"快速模式",都是给 AI 编程助手加速。
Anthropic 和 OpenAI 最近先后发布了各自的"快速模式",都是给 AI 编程助手加速。但仔细看,两家走的是完全不同的技术路线,背后的产品哲学也很不一样。
【1】两种快速模式,到底有什么区别
Anthropic 的 Fast Mode 在 2 月 8 日上线,面向 Claude Code 和 API 用户。开启后,Opus 4.6 的输出速度从约 65 token/秒提升到 ...
🔥Clawdbot爆火=AGI集体幻觉?大厂疯抢的赛道,可能从一开始就错了!
🔥Clawdbot爆火=AGI集体幻觉?大厂疯抢的赛道,可能从一开始就错了!
2026开年最魔幻的AI大戏:Clawdbot一个开源框架,让王慧文紧急调兵,阿里百度扎堆跟风,人人都喊“智能体iPhone时刻来了”🤖
但狂欢背后全是漏洞:“云端思考+本地执行”听着香,实则是把火箭发动机装自行车——大脑(大模型)连幻觉都没解决,就敢 ...
新人帖
9B端侧开源模型跑通百万上下文,面壁全新稀疏-线性混合注意力 最强的大模型,已经把scaling卷到了一个新维度:百万级上下文。
9B端侧开源模型跑通百万上下文,面壁全新稀疏-线性混合注意力
最强的大模型,已经把scaling卷到了一个新维度:百万级上下文。
几天前,Claude Opus 4.6发布,让人第一次真切感受到了百万上下文的涌现能力——
单次吃进50万字中文内容、实现跨文档法律分析、多轮Agent规划……
此情此景,用户火速用脚投票,华尔街更是 ...
AI越强大,你越需要真正懂点什么
【AI越强大,你越需要真正懂点什么】
Ryan Holiday 最近写了一篇长文,核心论点其实很古老:AI 擅长生成看起来合理的东西,但不擅长生成真正正确的东西。区分这两者的能力,恰恰依赖于那些"据说即将被淘汰"的旧技能。
他不是反技术的卢德分子。他用 ChatGPT 规划希腊旅行、给孩子生成故事。但他发现了一个规律:每次 AI ...
当LLM遇上提示注入:一场安全架构的集体补课
【当LLM遇上提示注入:一场安全架构的集体补课】
一位工程师在Reddit上发出求救:他们专门部署了自托管大模型来保护客户数据,结果QA测试时轻松注入提示,整个系统提示词被完整吐出。更糟糕的是,他们处理的是包含个人隐私信息的客服工单。
评论区瞬间炸开,但最高赞的回复却异常冷静:别在提示层面防注入了,假设模型一 ...
有什么东西是看起来很简单,实际上是很难的呢?
有什么东西是看起来很简单,实际上是很难的呢?
就是RAG,检索增强技术。
简单理解,就是你有个知识库,让大模型去搜索,回答分毫不差。
这个很多人想做,觉得自己本地有些知识库,加上大模型,就很好用了。
这个看起来很简单,不就搜索一下知识库嘛,你用向量检索之类的,很快就能做一个出来。
但是很难做得准确,直到最 ...