订阅

AI 评测与前沿 今日: 0|主题: 228|排名: 22 

  • 隐藏置顶帖 置顶 一起港湾 (17GW.com) 论坛发帖须知
    欢迎来到 一起港湾 (17GW) 社区!这里是 AI 技术爱好者、数码极客和生活分享者的精神家园。为了维护港湾的纯净秩序与技术氛围,请在开启您的分享之旅前,仔细阅读并遵守以下发帖规范。 一、 核心发帖准则 [*]主题契合,精准归类:请确保内容与所属版块(如 AI 技术、数码维修、资源分享等)相关。标题应简明扼要,避免“ ...
    1956 teanzhong 发表于 2026-3-29 站务公告与反馈
  • 今日AI热点(3.23)
    今日AI热点(3.23) 1. 英伟达NemoClaw发布:为OpenClaw打造企业级安全栈,三层防护解决部署风险 2. 黄仁勋高度评价OpenClaw:称其为史上最重要软件发布,普及速度超Linux 3. GPT-5 Codex定价出炉:输入$1.25/百万token,输出$10/百万token,专业能力强劲 4. MoltMatch事件:暴露AI智能体安全隐患,加速企业级安全方案落 ...
    1501 苯鸟 发表于 2026-3-24 AI 评测与前沿
  • 🔥分类赛道变天了!OpenRouter 最新一周数据:Jev 拿下分类请求 27% 份额,几乎是DeepSeek V4 Flash的 2 倍!
    🔥分类赛道变天了!OpenRouter 最新一周数据:Jev 拿下分类请求 27% 份额,几乎是DeepSeek V4 Flash的 2 倍! 当前分类请求前 3: 1️⃣TypeSafe Jev 1.13 — 27%(从接近 0 拉到第一) 2️⃣DeepSeek V4 Flash — 约 14%(此前长期第一) 3️⃣Google Gemma 4 26B A4B — 近期曾冲到 16%,现被迅速拉开 不是更大的 LLM ...
    087 透明的黑色 发表于 2026-9-27 AI 评测与前沿
  • 基于 FrontierHarness 和 @LotusDecoder 的工作,我们新增了针对 GLM-5.3 和 GLM-5.3-Flash 的 ZCode 支持。
    基于 FrontierHarness 和 @LotusDecoder 的工作,我们新增了针对 GLM-5.3 和 GLM-5.3-Flash 的 ZCode 支持。 ZCode 是目前针对 GLM-5.3 最强大的评测框架,且成本低于排名第二的“Claude Code + GLM-5.3”组合。 由于任务集规模较小,我们对每种组合进行了三次运行以降低方差。30 次尝试中的通过情况如下: - GLM-5.3:26 ...
    0181 远远落后 发表于 2026-9-14 AI 评测与前沿
  • 我针对实际任务测试了 DeepSeek V4.1 Flash。测试涉及 2 个代码库和 105 个隐藏 Bug,要求模型尽可能找出并修复这些问题。
    我针对实际任务测试了 DeepSeek V4.1 Flash。测试涉及 2 个代码库和 105 个隐藏 Bug,要求模型尽可能找出并修复这些问题。 Opus 5 (max): 27 Grok 4.6 (max): 27 DeepSeek V4.1 Flash (max): 24 GPT-5.6 Luna (xhigh): 23 Opus 5 (high): 21 对于日常任务而言,这确实是一款非常强大的模型。再来看看成本: Opus 5 (max) ...
    0169 chenyumai 发表于 2026-9-10 AI 评测与前沿
  • 全球最强模型Fable5.1发布#Anthropic这次更新Claude Fable 5.1与Mythos 5.1,把重心放在编程和科学能力上,这点我还挺看好。
    #全球最强模型Fable5.1发布#Anthropic这次更新Claude Fable 5.1与Mythos 5.1,把重心放在编程和科学能力上,这点我还挺看好。 不少基准测试数据,已经跑赢前代还有GPT‑5.6 Sol,纸面提升很突出。 再加上缓存费用直接下调75%,还配套企业安全方案,开发者的使用门槛会低不少。 但我始终觉得,跑分只能当作参考。实际写 ...
    0175 diyaxu88 发表于 2026-9-3 AI 评测与前沿
  • Anthropic深夜发布:Claude Fable 5.1、Claude Mythos 5.1,性能全面碾压前代
    Anthropic深夜发布:Claude Fable 5.1、Claude Mythos 5.1,性能全面碾压前代 科研智能体能力52.6%对Fable 5的24.7%,提升超过 110%,远超Opus 5的29.0%、GPT-5.6 Sol的22.4% 商业自动化31.4%vs17.1%提升近一倍,在复杂多步骤工作流中性能较强 这版引入了多档effort设置,Low/Medium/High/XHigh/ Max,性能曲线非常激进 ...
    0156 短腿小矮基 发表于 2026-9-3 AI 评测与前沿
  • Harness 的评测榜单 FrontierHarness v1.0
    Harness 的评测榜单 FrontierHarness v1.0 测试 harness 包括:Pi、Exo、Claude Code、Codex、DeepSeek Harness(4款)、Hermes、OpenCode、Oh My Pi、Kimi Code 测试模型:Kimi K3(选择K3,而不是 GPT、Claude,是因为测试者不想偏向 Codex 和 Claude Code) 任务类型: 21 项终端基准测试任务和 9 项深度软件工程任 ...
    0147 老脸往哪儿哥 发表于 2026-9-3 AI 评测与前沿
  • Google 发了 Gemini 3.8 Flash,跑分表上 14 项拿了 8 个第一,编程和 Agent 能力大幅提升,价格只有 Opus 5 的 15%。看起来很猛,但我觉得最值得聊的,恰恰是它"没赢"的那几项。
    Google 发了 Gemini 3.8 Flash,跑分表上 14 项拿了 8 个第一,编程和 Agent 能力大幅提升,价格只有 Opus 5 的 15%。看起来很猛,但我觉得最值得聊的,恰恰是它"没赢"的那几项。 Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%,差了两倍多。OSWorld-2.0 也被 Opus 5 甩开十几个点。这两项测的是什么?一个是极端复杂 ...
    0152 有点俗 发表于 2026-9-3 AI 评测与前沿
  • AI 的演进:从规则执行到自主行动
    AI 的演进:从规则执行到自主行动 人工智能的发展,不是简单的技术替代,而是机器处理信息的方式不断变化: 从人类编写规则,到机器从数据中学习,再到模型理解目标并自主完成任务。 1. 萌芽探索期:1950s—1960s 这一阶段,人们开始追问: 机器能像人一样思考吗? 1950年,图灵提出“机器能否思考”的问题;1956年达 ...
    0140 成鸿 发表于 2026-9-2 AI 评测与前沿
  • 🚨对比测评:神秘模型 Ox Alpha 性能封神!
    🚨对比测评:神秘模型 Ox Alpha 性能封神! OpenCode 刚放出的 stealth 模型 Ox Alpha,在 DeepSWE 10 个硬核任务实测中直接碾压一众一线模型,平均分高达 80%,把大家都整不会了。 关键要点拆解: 🔹实测成绩(10 任务均值)
• Ox Alpha:80%(8 个任务全过 ✓,仅 2 个 ×,且有接近过线)
• fable-5:65%
• glm ...
    0232 王允林 发表于 2026-8-21 AI 评测与前沿
  • Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一
    Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一 现在,Grok 有两代人跻身前三名 • #1 Grok 4.6 — ~95.9% • #2 GPT-5.6 Sol — ~94.7% • #3 Grok 4.5 — ~93.4% MedAgentBench 远远超出了回答医疗问题的范围 它在真实的电子健康记录环境中针对 10 个类别的 300 项临 ...
    0188 皮埃尔 发表于 2026-8-20 AI 评测与前沿
  • DeepSeek V4 Pro 正式版测评来了,SuperCLUE 综合总榜第2。
    DeepSeek V4 Pro 正式版测评来了,SuperCLUE 综合总榜第2。 对比预览版,几个关键数字变化挺大:智能体编程 47.37→63.16(+15.85),幻觉控制 79.70→89.73,任务规划也涨了6.48分。推理耗时同步优化了,不是纯堆分。 精确指令遵循小幅下滑,开发团队明显优先强化长链路智能体和深度推理。支持百万级长文本,开源。 跟 ...
    0180 木朵 发表于 2026-8-20 AI 评测与前沿
  • 24 人团队,撬动 AI 芯片格局,Taalas 被 AMD 收购背后,是算力战场的转向。
    24 人团队,撬动 AI 芯片格局,Taalas 被 AMD 收购背后,是算力战场的转向。 不同于英伟达通用 GPU 路线,Taalas 选择牺牲通用性,将模型直接固化进硬件,绕开 HBM 内存墙,实现超低延迟推理,但缺点也很明显:一块芯片只能跑一套模型,灵活性大打折扣。 AMD 这次收购,瞄准的正是高速推理赛道。 在训练市场竞争之外,推 ...
    0208 王吉杨 发表于 2026-8-20 AI 评测与前沿
  • LLM-as-a-Verifier 不断突破性价比的极限!
    LLM-as-a-Verifier 不断突破性价比的极限! 在 Terminal-Bench 2.1 测试中,它将 DeepSeek V4 Flash 的准确率从 79% 提升至 88%,而价格却比竞争对手低 4 到 11 倍! 点击此处体验:https://github.com/llm-as-a-verifier/llm-as-a-verifier @jackyk02
    0174 我爱榛子 发表于 2026-8-19 AI 评测与前沿
  • 阿里巴巴刚刚发布了它所缺少的那一块拼图 它叫 OpenSandbox。
    🚨中国人又干了一票!! 阿里巴巴刚刚发布了它所缺少的那一块拼图 它叫 OpenSandbox。 真正的隔离环境,让你的代理随心所欲。 里面可以运行什么: → Claude Code、Codex CLI、Gemini CLI、Qwen Code 和 Kimi CLI → Chrome 和 Playwright 用于自动化浏览 → 通过 VNC 的完整桌面 → 浏览器中的 VS Code → 多语言代码 ...
    0231 音乐人闭能文 发表于 2026-8-17 AI 评测与前沿
  • 三星开始让AI造芯片了:一个月的工作压缩到两天,Exynos研发迎来新变量
    三星开始让AI造芯片了:一个月的工作压缩到两天,Exynos研发迎来新变量 如果一个原本需要一个多月才能完成的芯片研发任务,现在两天就能搞定,会发生什么? 三星正在给出一个很有意思的答案。 根据韩国媒体最新报道,三星电子 System LSI 事业部从今年 5 月开始正式将 Anthropic 的 Claude Code 引入半导体研发,而且已 ...
    0220 爱深求 发表于 2026-8-17 AI 评测与前沿
  • #DeepSeekHarness发布# 【DeepSeek Harness 真正狠的地方,是它没有"核心"】
    #DeepSeekHarness发布# 【DeepSeek Harness 真正狠的地方,是它没有"核心"】 DeepSeek 的 agent 框架 Harness 上线三天,39,735 个 star。多数人当它是又一个 Coding 工具,但架构文档开头就写了它的定位:no privileged core,没有特权核心。 Claude Code、Codex 的内核是内置写死的。想加能力,走 MCP,在外部挂插件。a ...
    0211 想拒绝呼吸 发表于 2026-8-16 AI 评测与前沿
  • 黄仁勋9大预言!3年后机器人满街跑,AI将重塑世界。
    黄仁勋9大预言!3年后机器人满街跑,AI将重塑世界。 他是黄仁勋,英伟达“皮衣刀客”,手握全球AI算力命脉。2026年最新9大预言,每一条都将改变未来! 1、生成式AI只是开胃菜,智能体AI才是主菜,3年内爆发 2、3–5年机器人无处不在,走进家庭工厂 3、物理AI催生50万亿产业,2026是落地元年 4、数据中心变Token工厂,2 ...
    0595 大款和花花 发表于 2026-5-24 AI 评测与前沿
  • Antrophic is now the front runner of AI Boom
    0505 恒国 发表于 2026-5-15 AI 评测与前沿
  • 最近一次使用ChatGPT 5.5 Pro的体验 标题平平无奇,内容却让整个数学圈坐不住了。
    今天,菲尔兹奖得主Timothy Gowers在个人博客上发了一篇长文—— 最近一次使用ChatGPT 5.5 Pro的体验 标题平平无奇,内容却让整个数学圈坐不住了。 文中,他亲手验证了一个令整个数学界不寒而栗的事实: GPT-5.5 Pro,用了不到两个小时,独立完成了一项博士论文级别的数学研究。 而Gowers本人在整个过程中,数学贡献 ...
    0446 怀哥 发表于 2026-5-10 AI 评测与前沿
  • 下一页 »

    快速发帖

    还可输入 120 个字符
    您需要登录后才可以发帖 登录 | 立即注册

    本版积分规则

    关注公众号

    相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

    Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

    在本版发帖
    关注公众号
    返回顶部