新浪科技

我在FORCE大会站着看完全程,然后回家测了一晚上Seed 2.1 Pro

新浪财经头条

关注

来源:沃垠AI

昨天,火山引擎FORCE原动力大会,字节没有挤牙膏——一口气甩出五款模型:Seed 2.1 Pro、Seedance 2.5(7月中旬发布)、Seedance 2.0 4K版、Seedream 5.0 Pro、Seed Audio 1.0。

从基模到多模态生成,一条线全部拉满。

一句话认识这5款模型:

  • Seed 2.1 Pro:Coding、Agent、视觉理解全面升级,对标Opus-4.7和Gemini-3.1-Pro;

  • Seedance 2.5:原生直出30s视频,最多支持50个参考素材,还能对视频做二次编辑。一手独家:预计7月中旬上线。

  • Seedance 2.0 4K版:支持10-bit高位深原生直出,从源头就把视频细节留住。

  • Seedream 5.0 Pro:精准编辑、图层分离、高密度信息表达、多语种生成全面进步,明显更实用了。身边好友实测下来,能力卡在Banana Pro和Image2之间。

  • Seed Audio 1.0:不只是配个人声,而是一句Prompt直接产出「对白 + BGM + 音效」一体的成品音频,文生、参考生都支持。

把这五款摆在一起看,我的第一反应是——它们可以「合体」了。

一部影视级作品,人物图、场景图、道具图交给Seedream 5.0 Pro,视频交给Seedance 2.5,音频交给Seed Audio 1.0;要是你想搭一条自己的工作流,再用Seed 2.1 Pro做一个Agent把它们串起来。

是的,直接就loop model了。

这几款模型我都想上手测一测,尤其是Seedance 2.5。等拿到内测权限了,第一时间给大家安排测试。

今天,我先给大家看下Seed 2.1 Pro的实测效果。

一手实测

  • Coding篇

我直接接火山引擎的API,丢进Claude Code里开测。API URL和model分别是:

https://ark.cn-beijing.volces.com/api/compatibledoubao-seed-2-1-pro-260628

1)Case 1:设计3D网页

给一张金门大桥的实景照片,让模型按桥体的外观结构,写一个 3D 交互网页。

先看结果。

Seed 2.1准确还原出了金门大桥的标志性结构,大桥、水面、云朵和城市群的建模,也都还行。

这个Case我们测过一大票模型,老朋友应该有印象:GPT-5.5和DeepSeek-V4-Pro连桥体外观都还原不出来,吐出来的结构五花八门。

当然,建模细节和功能性这块,离Opus 4.8还差一口气。

2)Case2:设计财报网页

给了一张英伟达2027财年Q1的财报桑基图(静态图),让它读懂图里的数据和结构布局,做成一个能互动的财报网页。

这个Case特别考验模型的视觉理解、空间理解以及基础的财务知识,然后用Canvas和js组件把网页搭出来,且所有数据一个都不能错。

来看下它交出来的HTML。

所有卡片都能正常打开、缩放,收支数据也对得上账。

3)Case3:开发民宿官网

网站开发,还是我们的老case,给「冷同学的院子」设计一个官网。

和之前的测评一样,提示词一字未改。

One shot直出,看效果:

说句实在话:同样是one shot,Seed 2.1 Pro的成品比我之前测的M3、K2.7和Opus 4.8都要差一点点;但甩开GPT-5.5和DeepSeek-V4-Pro,依然毫无压力。

Coding我主要测了这3个Case。整体下来我的判断是:Seed 2.1 Pro在国内能进第一梯队,但跟Opus 4.8/4.7比,还有一段路要走。

  • Agent篇

测完Coding,我们换个战场——测几个真实的生产力场景。

这里,要用到豆包或TRAE。目前有3种方式能体验Seed 2.1 Pro:

①打开豆包电脑版或豆包App,选择 “办公任务” 模式;

②打开TRAE Work或TRAE IDE,内置模型选择Doubao-Seed-2.1-Pro;

③在火山引擎API接入,它分Pro和Turbo两个版本。

4)Case4:自动打开网页并统计数据

第一个,是我一直想干的事:让豆包打开豆瓣,统计近三年的9分电影。

它的思考过程我给大家放出来了。

中间有意思的是——单纯browser use跑不通时,它不会卡死,而是自己换思路、调新工具,直到任务的完成。

最后统计出来的结果,还挺准。

5)Case5:做PPT

统计完9分电影,我顺手让它做了份PPT,风格、审美什么的,我全都没做要求,让模型自己发挥。

最终的产物,摘几页给大家看,内容质量和排版审美相当能打。

这是真PPT,连备注都有,可以自由修改,也可以随时导pptx、pdf格式。

最近好几个朋友问我用什么AI做PPT,我给的答案都是「豆包」。

6)Case6:复杂长程任务

最后一个case,我测了个复杂一点的长程任务。

给它一个「联网搜索+office三件套生成+skill调用」的长程任务,给苹果公司做估值建模。

先看它搭的财务模型:预测苹果未来三年营收分别为4480、4795、5096亿美元,平均年增长率约7%。

背后是一整套数据分析撑着的。

还有它写的研究报告。

以及PPT。

三份产物,完成度都很能打。这个Case的难点在于:它不是「联网搜一搜、再总结一下」就完事,而是要求模型有自己的预测、自己的推理和判断。

这不只考验长程稳定性和工具调用能力,更是对推理能力的硬核拷问。

而且u1s1,Seed 2.1 Pro交付的那份财务模型Excel,是我最近测过的模型里,做得最好看的一家——没有之一。

Seed 2.1 Pro的长程能力,是真有点东西。

三个生产力Case跑完,我的结论是:Seed 2.1 Pro在General Agent(通用Agent)上的提升非常猛,执行复杂任务明显更靠谱了。

真实的工作流,从来不发生在一个固定界面、一条固定流程里,而是要在聊天、搜索、浏览器、代码仓库、文件和外部工具之间反复横跳。

所以Seed 2.1 Pro进一步朝通用型Computer-Use Agent(CUA)的方向打磨,让模型能在跨环境、跨工具、跨交互方式的任务里,稳稳地一路推进。

在生产力场景,Seed 2.1 Pro绝对算得上一款好用的底模。

写在最后

FORCE大会上,火山引擎总裁谭待抛出一个观点:「模型只有跨越“质变点”,才真正具备满足企业和个人生产需求的能力。」

这话很实在。视频领域,Seedance 2.0就是那个质变点,它让AI视频迅速在行业里铺开、落地;Coding和Agent领域,代表模型是Claude Opus 4.6,从这之后大家都卷起了Agent和长程能力。

今天的Seed 2.1 Pro,走的也是这条路:死磕自己的Coding、Agent和VLM能力。

我自己实测下来,它在Coding上离顶尖、前沿还有差距;但在生产力场景里的Agent能力是真的可以,跨工具、跨环境的任务交付质量都很高。

用一句话总结就是:它不前沿,但更实用了。

这也就不难理解,为什么这届FORCE大会能爆满到这个程度——我只是晚到了那么一丢丢,就只能在现场享受「站票」待遇。而且不止我一个,很多朋友都是从头站着看完整场发布会的。

人山人海,词元跳动。

特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的30天内进行。

加载中...