简体 | 繁体
loading...
新闻频道
  • 首页
  • 新闻
  • 读图
  • 财经
  • 教育
  • 家居
  • 健康
  • 美食
  • 时尚
  • 旅游
  • 影视
  • 博客
  • 群吧
  • 论坛
  • 电台
  • 焦点新闻
  • 图片新闻
  • 视频新闻
  • 生活百态
  • 娱乐新闻
您的位置: 文学城 » 新闻 » 焦点新闻 » 梁文峰对垒马斯克,DeepSeek深夜上新

梁文峰对垒马斯克,DeepSeek深夜上新

文章来源: ZAKER 于 2026-08-12 20:05:04 - 新闻取自各大新闻媒体,新闻内容并不代表本网立场!
被阅读次数

8月12日深夜,DeepSeek官网API文档更新,模型版本从V4-Pro预览版切换为“DeepSeek-V4-Pro-0813”。几乎同一时间,马斯克旗下SpaceXAI发布了新一代模型Grok4.6。

两款主打高性价比的模型同夜撞车,梁文锋与马斯克的双强对垒,真正感受到压力的可能是OpenAI和Anthropic。

从DeepSeek官方群流出的一张评测对比表显示,V4 Pro正式版在多项智能体测试中表现亮眼。在衡量AI智能体完成真实终端环境复杂任务能力的Terminal Bench 2.1上,V4 Pro拿下87.9分,距离全球第一的Anthropic Fable 5仅差0.1分。相比预览版72.1分的成绩,三个月跃升了15.8分。

在AI安全智能体基准Cybergym上,V4 Pro以83.3分压过Fable 5的83.1分;在工作流智能体测试AutomationBench中,31.8分对29.1分同样胜出。

衡量软件工程能力的DeepSWE上,分数从预览版的12.8分飙升至62.7分,接近原来的五倍,超越了Anthropic上一代旗舰Opus 4.8的58.0分。V4 Pro正式版支持100万Token上下文长度,最大输出384K Token,并兼容OpenAI和Anthropic两种API格式,开发者几乎无需修改代码即可完成切换。

智能体是理解这次升级的关键。Terminal Bench、DeepSWE这类测试考察的是AI能不能真正“干活”——调用工具、执行多步骤任务、编写和修改代码、在长链条中持续推进直到交付结果。这正是大模型从聊天玩具走向生产工具的核心门槛。

就在V4 Pro上线前几个小时,马斯克旗下SpaceXAI发布的Grok 4.6同样剑指长周期智能体任务。在面向真实知识工作的GDPVal-AA v2评估中,Grok 4.6以1753 Elo登顶,超过了Fable 5的1741和GPT-5.6 Sol Max的1728。两款模型不约而同地将矛头指向同一件事:让AI在长任务中稳定交付可用成果。

然而价格差距令人咋舌。Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max为30美元,Grok 4.6为6美元,而DeepSeek V4 Pro仅为0.87美元,约为Fable 5的五十七分之一。0.1分的跑分差距背后,是五十七倍的价格鸿沟。

DeepSeek此次发布的另一重看点,是其智能体工具“Harness”的推进。有媒体报道,DeepSeek Harness于2026年5月内部立项,由崔添翼担任负责人。

崔添翼毕业于浙江大学计算机系,曾在量化交易机构Jane Street任职九年,2026年3月加入DeepSeek。“DeepSeek Harness团队”公众号已于今年7月6日正式注册。8月1日,崔添翼曾面向全球公开征集Harness内测用户。

性能飙升的同时,涨价预告也随之而来。8月6日,DeepSeek在开放平台发布公告,计划近期整体上调API服务定价,预计涨幅较大。这是DeepSeek首次预告整体上调API价格,而非此前针对高峰时段的局部调整。

梳理其定价时间线:4月V4发布时,V4 Pro API以2.5折优惠上线;5月31日优惠结束后,直接永久降至原价的四分之一;6月29日又引入峰谷计费。从永久降价到预告大涨,中间只隔了两个多月。

如果只把涨价理解为“扛不住成本”,可能低估了DeepSeek的意图。仅仅两个月前的6月16日,DeepSeek刚刚完成成立以来首轮外部融资,募资总额超过500亿元人民币,投后估值突破3500亿元,创下中国AI行业单轮融资纪录。

最新消息显示,DeepSeek已在推动第二轮融资,计划募资约500亿元,投前估值约5000亿元。摩根士丹利8月9日发布的研报给出了三个驱动因素:V4模型需求旺盛支撑了更强的定价能力;厂商需要在市场份额与毛利率之间寻求平衡,以持续投入前沿模型研发;更多使用国产芯片可能带来更高的推理成本。

报告认为,模型智能而非价格,才是大模型竞争的终极壁垒。

DeepSeek的涨价并非孤例。据摩根士丹利统计,以字节跳动、阿里、百度、腾讯、智谱、月之暗面、MiniMax及DeepSeek为样本,中国大模型平均API输出价格已从2025年一季度的约12.2元/百万Token回升至2026年二季度的21.9元/百万Token。智谱API定价较去年底累计上调约83%,但调用量反而增长了400%。腾讯在3月至4月间两轮上调模型API价格,部分涨幅高达463%。

纵观整个AI行业,算力供需、芯片采购成本、运营成本持续走高,单纯靠低价换规模的模式难以为继。当头部厂商都不再以价格为唯一竞争手段,行业下半场的焦点已经明确:不是谁更便宜,而是谁真能解决问题。

`
  • 月满中秋,把健康送给自己,也送给最牵挂的人。美国专利产品【骨精华】守护骨骼与关节健康;【心血通】支持心血管健康;【益脑灵】呵护脑部健康与记忆力。
`
查看评论(3)
  • 文学城简介
  • 广告服务
  • 联系我们
  • 招聘信息
  • 注册笔名
  • 申请版主
  • 收藏文学城

WENXUECITY.COM does not represent or guarantee the truthfulness, accuracy, or reliability of any of communications posted by other users.

Copyright ©1998-2026 wenxuecity.com All rights reserved. Privacy Statement & Terms of Use & User Privacy Protection Policy

24小时热点排行

女子声称被4岁男童摸臀,演员伊能静发声
华裔少年“拆斯坦福Offer”爆红 竟已休学 现况更惊人
微信一单$980长途单的代价:绿卡被撤 坐牢 错过女儿出生
警察:“我们背后是国家,你有吗?把你搞废又怎样?”
四年半亏掉百亿,原董事长大搞权色交易






24小时讨论排行

加拿大反击美国 总理卡尼提醒国民:需要付出代价
中国出口继续飙升,专家:将加剧与贸易伙伴紧张局势
加总理对全国讲话:加拿大诞生于“对抗美国侵略”
英王发信划清界限,哈里夫妇被曝感到有点惊讶
中国博主在伦敦遭殴打,数千人直播目睹全过程
华为纽约受审:这场横跨八年的刑事案件要知道什么
郭德纲处罚落地,他还能演吗?
默克尔谈德国政坛最新变化:这是真正的转折点
中国大杀器破功 马斯克Cybercab电机摆脱稀土依赖
美弹荒有解?低成本巡弋导弹年产1.2万枚 剑指北京
清华大学杨振宁高等研究院揭牌,翁帆出席并发言
被捧高又狠狠摔下:“最年轻黑人教授”的最后9天
白宫发布动画:特朗普为了MAGA而不知疲倦地工作!
女子被控“发视频寻衅滋事”遭羁押608天后检方撤诉
马斯克遭爆内战前要有一群孩子,前女友全说了
西班牙首相:我可能是条狗 但不像你 我没有主人
文学城新闻
切换到网页版

梁文峰对垒马斯克,DeepSeek深夜上新

ZAKER 2026-08-12 20:05:04

8月12日深夜,DeepSeek官网API文档更新,模型版本从V4-Pro预览版切换为“DeepSeek-V4-Pro-0813”。几乎同一时间,马斯克旗下SpaceXAI发布了新一代模型Grok4.6。

两款主打高性价比的模型同夜撞车,梁文锋与马斯克的双强对垒,真正感受到压力的可能是OpenAI和Anthropic。

从DeepSeek官方群流出的一张评测对比表显示,V4 Pro正式版在多项智能体测试中表现亮眼。在衡量AI智能体完成真实终端环境复杂任务能力的Terminal Bench 2.1上,V4 Pro拿下87.9分,距离全球第一的Anthropic Fable 5仅差0.1分。相比预览版72.1分的成绩,三个月跃升了15.8分。

在AI安全智能体基准Cybergym上,V4 Pro以83.3分压过Fable 5的83.1分;在工作流智能体测试AutomationBench中,31.8分对29.1分同样胜出。

衡量软件工程能力的DeepSWE上,分数从预览版的12.8分飙升至62.7分,接近原来的五倍,超越了Anthropic上一代旗舰Opus 4.8的58.0分。V4 Pro正式版支持100万Token上下文长度,最大输出384K Token,并兼容OpenAI和Anthropic两种API格式,开发者几乎无需修改代码即可完成切换。

智能体是理解这次升级的关键。Terminal Bench、DeepSWE这类测试考察的是AI能不能真正“干活”——调用工具、执行多步骤任务、编写和修改代码、在长链条中持续推进直到交付结果。这正是大模型从聊天玩具走向生产工具的核心门槛。

就在V4 Pro上线前几个小时,马斯克旗下SpaceXAI发布的Grok 4.6同样剑指长周期智能体任务。在面向真实知识工作的GDPVal-AA v2评估中,Grok 4.6以1753 Elo登顶,超过了Fable 5的1741和GPT-5.6 Sol Max的1728。两款模型不约而同地将矛头指向同一件事:让AI在长任务中稳定交付可用成果。

然而价格差距令人咋舌。Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max为30美元,Grok 4.6为6美元,而DeepSeek V4 Pro仅为0.87美元,约为Fable 5的五十七分之一。0.1分的跑分差距背后,是五十七倍的价格鸿沟。

DeepSeek此次发布的另一重看点,是其智能体工具“Harness”的推进。有媒体报道,DeepSeek Harness于2026年5月内部立项,由崔添翼担任负责人。

崔添翼毕业于浙江大学计算机系,曾在量化交易机构Jane Street任职九年,2026年3月加入DeepSeek。“DeepSeek Harness团队”公众号已于今年7月6日正式注册。8月1日,崔添翼曾面向全球公开征集Harness内测用户。

性能飙升的同时,涨价预告也随之而来。8月6日,DeepSeek在开放平台发布公告,计划近期整体上调API服务定价,预计涨幅较大。这是DeepSeek首次预告整体上调API价格,而非此前针对高峰时段的局部调整。

梳理其定价时间线:4月V4发布时,V4 Pro API以2.5折优惠上线;5月31日优惠结束后,直接永久降至原价的四分之一;6月29日又引入峰谷计费。从永久降价到预告大涨,中间只隔了两个多月。

如果只把涨价理解为“扛不住成本”,可能低估了DeepSeek的意图。仅仅两个月前的6月16日,DeepSeek刚刚完成成立以来首轮外部融资,募资总额超过500亿元人民币,投后估值突破3500亿元,创下中国AI行业单轮融资纪录。

最新消息显示,DeepSeek已在推动第二轮融资,计划募资约500亿元,投前估值约5000亿元。摩根士丹利8月9日发布的研报给出了三个驱动因素:V4模型需求旺盛支撑了更强的定价能力;厂商需要在市场份额与毛利率之间寻求平衡,以持续投入前沿模型研发;更多使用国产芯片可能带来更高的推理成本。

报告认为,模型智能而非价格,才是大模型竞争的终极壁垒。

DeepSeek的涨价并非孤例。据摩根士丹利统计,以字节跳动、阿里、百度、腾讯、智谱、月之暗面、MiniMax及DeepSeek为样本,中国大模型平均API输出价格已从2025年一季度的约12.2元/百万Token回升至2026年二季度的21.9元/百万Token。智谱API定价较去年底累计上调约83%,但调用量反而增长了400%。腾讯在3月至4月间两轮上调模型API价格,部分涨幅高达463%。

纵观整个AI行业,算力供需、芯片采购成本、运营成本持续走高,单纯靠低价换规模的模式难以为继。当头部厂商都不再以价格为唯一竞争手段,行业下半场的焦点已经明确:不是谁更便宜,而是谁真能解决问题。