订阅

AI 评测与前沿 今日: 0|主题: 225|排名: 29 

  • 隐藏置顶帖 置顶 一起港湾 (17GW.com) 论坛发帖须知
    欢迎来到 一起港湾 (17GW) 社区!这里是 AI 技术爱好者、数码极客和生活分享者的精神家园。为了维护港湾的纯净秩序与技术氛围,请在开启您的分享之旅前,仔细阅读并遵守以下发帖规范。 一、 核心发帖准则 [*]主题契合,精准归类:请确保内容与所属版块(如 AI 技术、数码维修、资源分享等)相关。标题应简明扼要,避免“ ...
    1825 teanzhong 发表于 2026-3-29 站务公告与反馈
  • 全球最强模型Fable5.1发布#Anthropic这次更新Claude Fable 5.1与Mythos 5.1,把重心放在编程和科学能力上,这点我还挺看好。 New
    #全球最强模型Fable5.1发布#Anthropic这次更新Claude Fable 5.1与Mythos 5.1,把重心放在编程和科学能力上,这点我还挺看好。 不少基准测试数据,已经跑赢前代还有GPT‑5.6 Sol,纸面提升很突出。 再加上缓存费用直接下调75%,还配套企业安全方案,开发者的使用门槛会低不少。 但我始终觉得,跑分只能当作参考。实际写 ...
    058 diyaxu88 发表于 6 天前 AI 评测与前沿
  • Anthropic深夜发布:Claude Fable 5.1、Claude Mythos 5.1,性能全面碾压前代 New
    Anthropic深夜发布:Claude Fable 5.1、Claude Mythos 5.1,性能全面碾压前代 科研智能体能力52.6%对Fable 5的24.7%,提升超过 110%,远超Opus 5的29.0%、GPT-5.6 Sol的22.4% 商业自动化31.4%vs17.1%提升近一倍,在复杂多步骤工作流中性能较强 这版引入了多档effort设置,Low/Medium/High/XHigh/ Max,性能曲线非常激进 ...
    043 短腿小矮基 发表于 6 天前 AI 评测与前沿
  • Harness 的评测榜单 FrontierHarness v1.0 New
    Harness 的评测榜单 FrontierHarness v1.0 测试 harness 包括:Pi、Exo、Claude Code、Codex、DeepSeek Harness(4款)、Hermes、OpenCode、Oh My Pi、Kimi Code 测试模型:Kimi K3(选择K3,而不是 GPT、Claude,是因为测试者不想偏向 Codex 和 Claude Code) 任务类型: 21 项终端基准测试任务和 9 项深度软件工程任 ...
    035 老脸往哪儿哥 发表于 6 天前 AI 评测与前沿
  • Google 发了 Gemini 3.8 Flash,跑分表上 14 项拿了 8 个第一,编程和 Agent 能力大幅提升,价格只有 Opus 5 的 15%。看起来很猛,但我觉得最值得聊的,恰恰是它"没赢"的那几项。 New
    Google 发了 Gemini 3.8 Flash,跑分表上 14 项拿了 8 个第一,编程和 Agent 能力大幅提升,价格只有 Opus 5 的 15%。看起来很猛,但我觉得最值得聊的,恰恰是它"没赢"的那几项。 Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%,差了两倍多。OSWorld-2.0 也被 Opus 5 甩开十几个点。这两项测的是什么?一个是极端复杂 ...
    035 有点俗 发表于 6 天前 AI 评测与前沿
  • AI 的演进:从规则执行到自主行动
    AI 的演进:从规则执行到自主行动 人工智能的发展,不是简单的技术替代,而是机器处理信息的方式不断变化: 从人类编写规则,到机器从数据中学习,再到模型理解目标并自主完成任务。 1. 萌芽探索期:1950s—1960s 这一阶段,人们开始追问: 机器能像人一样思考吗? 1950年,图灵提出“机器能否思考”的问题;1956年达 ...
    042 成鸿 发表于 7 天前 AI 评测与前沿
  • 🚨对比测评:神秘模型 Ox Alpha 性能封神!
    🚨对比测评:神秘模型 Ox Alpha 性能封神! OpenCode 刚放出的 stealth 模型 Ox Alpha,在 DeepSWE 10 个硬核任务实测中直接碾压一众一线模型,平均分高达 80%,把大家都整不会了。 关键要点拆解: 🔹实测成绩(10 任务均值)
• Ox Alpha:80%(8 个任务全过 ✓,仅 2 个 ×,且有接近过线)
• fable-5:65%
• glm ...
    0130 王允林 发表于 2026-8-21 AI 评测与前沿
  • Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一
    Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一 现在,Grok 有两代人跻身前三名 • #1 Grok 4.6 — ~95.9% • #2 GPT-5.6 Sol — ~94.7% • #3 Grok 4.5 — ~93.4% MedAgentBench 远远超出了回答医疗问题的范围 它在真实的电子健康记录环境中针对 10 个类别的 300 项临 ...
    087 皮埃尔 发表于 2026-8-20 AI 评测与前沿
  • DeepSeek V4 Pro 正式版测评来了,SuperCLUE 综合总榜第2。
    DeepSeek V4 Pro 正式版测评来了,SuperCLUE 综合总榜第2。 对比预览版,几个关键数字变化挺大:智能体编程 47.37→63.16(+15.85),幻觉控制 79.70→89.73,任务规划也涨了6.48分。推理耗时同步优化了,不是纯堆分。 精确指令遵循小幅下滑,开发团队明显优先强化长链路智能体和深度推理。支持百万级长文本,开源。 跟 ...
    075 木朵 发表于 2026-8-20 AI 评测与前沿
  • 24 人团队,撬动 AI 芯片格局,Taalas 被 AMD 收购背后,是算力战场的转向。
    24 人团队,撬动 AI 芯片格局,Taalas 被 AMD 收购背后,是算力战场的转向。 不同于英伟达通用 GPU 路线,Taalas 选择牺牲通用性,将模型直接固化进硬件,绕开 HBM 内存墙,实现超低延迟推理,但缺点也很明显:一块芯片只能跑一套模型,灵活性大打折扣。 AMD 这次收购,瞄准的正是高速推理赛道。 在训练市场竞争之外,推 ...
    0103 王吉杨 发表于 2026-8-20 AI 评测与前沿
  • LLM-as-a-Verifier 不断突破性价比的极限!
    LLM-as-a-Verifier 不断突破性价比的极限! 在 Terminal-Bench 2.1 测试中,它将 DeepSeek V4 Flash 的准确率从 79% 提升至 88%,而价格却比竞争对手低 4 到 11 倍! 点击此处体验:https://github.com/llm-as-a-verifier/llm-as-a-verifier @jackyk02
    060 我爱榛子 发表于 2026-8-19 AI 评测与前沿
  • 阿里巴巴刚刚发布了它所缺少的那一块拼图 它叫 OpenSandbox。
    🚨中国人又干了一票!! 阿里巴巴刚刚发布了它所缺少的那一块拼图 它叫 OpenSandbox。 真正的隔离环境,让你的代理随心所欲。 里面可以运行什么: → Claude Code、Codex CLI、Gemini CLI、Qwen Code 和 Kimi CLI → Chrome 和 Playwright 用于自动化浏览 → 通过 VNC 的完整桌面 → 浏览器中的 VS Code → 多语言代码 ...
    0118 音乐人闭能文 发表于 2026-8-17 AI 评测与前沿
  • 三星开始让AI造芯片了:一个月的工作压缩到两天,Exynos研发迎来新变量
    三星开始让AI造芯片了:一个月的工作压缩到两天,Exynos研发迎来新变量 如果一个原本需要一个多月才能完成的芯片研发任务,现在两天就能搞定,会发生什么? 三星正在给出一个很有意思的答案。 根据韩国媒体最新报道,三星电子 System LSI 事业部从今年 5 月开始正式将 Anthropic 的 Claude Code 引入半导体研发,而且已 ...
    0110 爱深求 发表于 2026-8-17 AI 评测与前沿
  • #DeepSeekHarness发布# 【DeepSeek Harness 真正狠的地方,是它没有"核心"】
    #DeepSeekHarness发布# 【DeepSeek Harness 真正狠的地方,是它没有"核心"】 DeepSeek 的 agent 框架 Harness 上线三天,39,735 个 star。多数人当它是又一个 Coding 工具,但架构文档开头就写了它的定位:no privileged core,没有特权核心。 Claude Code、Codex 的内核是内置写死的。想加能力,走 MCP,在外部挂插件。a ...
    098 想拒绝呼吸 发表于 2026-8-16 AI 评测与前沿
  • 黄仁勋9大预言!3年后机器人满街跑,AI将重塑世界。
    黄仁勋9大预言!3年后机器人满街跑,AI将重塑世界。 他是黄仁勋,英伟达“皮衣刀客”,手握全球AI算力命脉。2026年最新9大预言,每一条都将改变未来! 1、生成式AI只是开胃菜,智能体AI才是主菜,3年内爆发 2、3–5年机器人无处不在,走进家庭工厂 3、物理AI催生50万亿产业,2026是落地元年 4、数据中心变Token工厂,2 ...
    0489 大款和花花 发表于 2026-5-24 AI 评测与前沿
  • Antrophic is now the front runner of AI Boom
    0392 恒国 发表于 2026-5-15 AI 评测与前沿
  • 最近一次使用ChatGPT 5.5 Pro的体验 标题平平无奇,内容却让整个数学圈坐不住了。
    今天,菲尔兹奖得主Timothy Gowers在个人博客上发了一篇长文—— 最近一次使用ChatGPT 5.5 Pro的体验 标题平平无奇,内容却让整个数学圈坐不住了。 文中,他亲手验证了一个令整个数学界不寒而栗的事实: GPT-5.5 Pro,用了不到两个小时,独立完成了一项博士论文级别的数学研究。 而Gowers本人在整个过程中,数学贡献 ...
    0332 怀哥 发表于 2026-5-10 AI 评测与前沿
  • 索尼 AI 发布的一段视频显示
    索尼 AI 发布的一段视频显示 展示了一个代号为 Ace 的自主乒乓球机器人 再正式规则下和人类高水平选手对打的画面 该机器人在与顶尖人类球员的对决中不仅能轻松应对,有时甚至能将人类选手击败... 乒乓球运动是一项需要高速感知、实时决策、精确执行的竞争性运动 球速通常在 70到100 km/h... 机器人需要再不到 0.1 秒 ...
    0393 sinalook 发表于 2026-4-24 AI 评测与前沿
  • Token消耗榜挺有意思的… ​​​
    0381 Oracle 发表于 2026-4-14 AI 评测与前沿
  • 【AIGC日报】2026.4.12 | 今日要闻速览
    【AIGC日报】2026.4.12 | 今日要闻速览 1、智谱GLM-5.1编程能力首超GPT-5.4,国产算力闭环跑通 2、阿里Wan 2.7-Video正式发布,AI视频迈入「导演时代」 3、OpenAI GPT-6官宣4月14日发布,200万token超长上下文 4、DeepSeek V4确认4月下旬发布,万亿参数+国产芯片适配 5、华为新一代算力芯片发布,性能达英伟达H20的2.87倍 ...
    0375 小川8433651 发表于 2026-4-12 AI 评测与前沿
  • 据传 Anthropic 正在测试一个代号为「Conway」的突破性新项目,一个“永远在线”的 AI Agent
    据传 Anthropic 正在测试一个代号为「Conway」的突破性新项目,一个“永远在线”的 AI Agent,Claude 从被动的 ChatBot 转变为自主的 Digital Twin!怎么感觉这是 Anthropic 的 Siri,也期待今年 WWDC Siri 的框架大更新 ✨ http://t.cn/AXImXDLf ​​​ ...
    0382 湖泊 发表于 2026-4-10 AI 评测与前沿
  • 下一页 »

    快速发帖

    还可输入 120 个字符
    您需要登录后才可以发帖 登录 | 立即注册

    本版积分规则

    关注公众号

    相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

    Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

    在本版发帖
    关注公众号
    返回顶部