新闻详情

新闻详情

首页 / 资讯中心 / 详情

Step 5 Preview + StepAudio 3,我做了一个可以直接对话的 AI 深夜电台

发布时间:2026/9/25 21:46:38来源:尧图网络
Step 5 Preview + StepAudio 3,我做了一个可以直接对话的 AI 深夜电台
我把一个 AI 深夜电台交给 Step 5 Preview它自己把项目跑完了Step 5 Preview 实测从设计图到 AI 深夜电台全程自己开发调试让 Step 5 Preview 做一个 AI 深夜电台看看它能自己干到哪一步这是阶跃星辰最新的旗舰模型官方对它的定位很明确重点就是面向 Agent 真实任务。模型采用 MoE 架构总参数量 600B每个 Token 激活 27B 参数同时支持 100 万 Token 上下文和视觉输入。官方把这个方向称为新一代智能效率的帕累托前沿.这次 Step 5 Preview 比较值得关注的地方就是 Coding 和长任务执行能力。从公开评测到内部测试Step 5 Preview 在软件工程、Agent、专业工作和金融等多个方向上都取得了有竞争力的结果。在成本上这次Step 5 Preview也有比较大的优势百万tokens输入价格只有7元。相比其他国产最新旗舰模型价格上也是具有优势的。另外一个我比较感兴趣的点就是它处理长任务的方式。一个项目交给它之后它可以根据运行结果继续修改、测试再根据新的结果决定下一步怎么做。这个能力其实很适合放在 WorkBuddy 这种 Agent 环境里面测试。所以这次我不准备只让它写一个简单页面。我直接做一个稍微完整一点的前端项目AI 深夜电台。在WorkBuddy中选择代码发开任务模块。把提示词复制到对话框中把设计概率图也一同给到模型。下面就等待Step-5-preview制作出第一版网页效果。这里可以看到模型已经把「AI 深夜电台」的页面完整制作出来并且还进行了实际运行验证。从项目结构也能看出来这次模型没有把所有功能堆在一个 HTML 里面而是按照功能进行了拆分。除了前端页面之外项目还拆分了播放器、实时波形、语音识别、AI 对话、语音合成等多个功能模块同时预留了StepAudio 3的 API 配置。还原度很高基本达到了设计图的要求因为中间的播放器部分如果要制作出来的话需要制作3D模型绑定骨骼才可以正常使用所以这里模型就处理为了一个正常的播放器页面。配色和样子基本上都是按照设计图和提示词来制作的。 试一下功能点击按住说话成功吊起浏览器的麦克风权限说明麦克风功能是没有问题的。因为现在还是第一版还没有配置StepAudio 3 语音功能所以模型进行了降级处理采用浏览器合成 / Mock合成语音让demo更有全面不至于语音功能为空白。只不过这个语音就很拉胯了声音机械感很强而且回复的内容也很抽象。然后我看见模型在WorkBuddy上的任务并没有停止而是在不断的修改页面的小问题。修改完成后模型也没有直接交付项目而是在不断的测试。这种流程就比较智能了因为大部分AI写的项目模型自己会修改bug但是一旦检测到bug已经被修改后模型会直接生成交付语句也就是在Agent中看见的回复内容。比如这种但 Step 5 Preview并没有直接进行交付而是不断在进行测试测试每一个接口每一个功能是否正常运行。在模型自行测试的过程中不断的修复bug优化代码。虽然这样可能会比较消耗时间但是从项目完成度上来讲模型的严谨性还是很强的。第一步就制作完成了然后就是配置语音模型了语音模型我也采用阶跃的语音模型StepAudio 3.在阶跃星辰的开发文档里面把语音配置信息拷贝下来当然也可以直接把文档的链接丢给WorkBuddy只要模型可以读取到配置信息即可。这里我选择两个官方的音色。等待模型识别任务继续后续的开发任务。后续开发任务中模型沿用了前面任务制作流程先写代码然后检测bug再检测无bug后编写测试案例功能点通过测试案例后模型还要删掉没用的文件最终才形成交付文件。这套流程还是很规范的。点击文字发送查看是否可以正常交流。OK文字交流没有问题而且AI角色也是根据我的问题来进行回复我的不是demo中固定语句。音色也得到了优化这一版的人声更加的贴合我们的产品主题声音温柔知性。右边为部分配置信息可以配置不同的音色语音识别还可以制作AI音乐。点击语音合成进入到音色配置信息中可以根据自己想喜好选择不同的音色当然也使用其他音色甚至开可以制作自己喜欢的音色音色克隆只不过这里还没有迭代到下一个版本。音乐生成也是比较简单的AI音乐声场这里也是可以迭代的通过提示词来调整音乐的生成。最后就是语音识别功能了实际测试下来识别也没什么问题到这里整个 Demo 基本就制作完成了。总体体验下来我觉得 Step 5 Preview 做这种前端小项目最大的优点就是它会自己判断项目当前的问题并且主动去检测和修改代码。很多时候我只需要把需求说清楚后面的实现、调试、检查基本都可以交给模型自己完成不需要我再反复提醒哪里有问题、下一步该做什么。这样做项目的时候会省事很多一个需求给下去模型可以自己把整个流程继续往下推进。因为模型Step 5 Preview本身就属于多模态所以对设计图的理解也很到位除了中间的留声机模型没办法制作之外其他部分的网页设计基本上都是按照设计图来开发的。后续如果要继续迭代功能的话那么就需要数据库了把用户的数据存入进去然后制作一个简单的知识库保留用户的聊天习惯和重要事项其次就是增加更多的音色选项和其他功能点最后加上这个留声机模型增加用户互动感那么这个demo就可以落地了。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Atlas 300V 24G实战:用NPU加速卡部署YOLO推理的全流程指南 2026/9/25 22:25:56

Atlas 300V 24G实战:用NPU加速卡部署YOLO推理的全流程指南

前阵子项目做边缘侧视频流目标检测,手里原本用的是GPU,但客户指定设备时偏偏是一块Atlas 300V 24G。拿到卡的第一反应其实和很多人一样:这东西到底算不算运算加速卡?能不能直接把YOLO塞进去跑?后来折腾了几天&#xff…

阅读更多 →
【无标题】27届软件工程找实习总结 2026/9/25 22:25:56

【无标题】27届软件工程找实习总结

很多同学并不是能力不够,而是准备方向和现在企业真正需要的能力出现了偏差。很多计算机学生到了大三、大四,准备秋招的时候,依然把大量时间投入在传统Java项目上,比如SpringBoot商城系统、校园二手交易平台、博客管理系统、后台管…

阅读更多 →
Atlas 300V实战:昇腾AI加速卡上部署YOLO模型全攻略 2026/9/25 22:25:56

Atlas 300V实战:昇腾AI加速卡上部署YOLO模型全攻略

先回答那个被搜了很多次的问题:Atlas 300V 24G,确实是一块运算加速卡,而且是一块专门为AI推理设计的加速卡。但它和你熟悉的英伟达GPU有本质区别——它不是拿来跑CUDA的,底层走的是完全不同的计算架构和软件栈。很多人第一次接触A…

阅读更多 →
为什么我给智能体做技能库,而不是写一堆 Prompt? 2026/9/25 22:25:50

为什么我给智能体做技能库,而不是写一堆 Prompt?

为什么我给智能体做了一套“技能库”而不是写一堆Prompt做AI Agent开发这段时间,我踩过最深的坑,就是看着模型一本正经地“表演”干活,最后却给我返回一堆毫无用处的文本。你问它今天天气,它能给你写一篇80字的作文;你…

阅读更多 →
Codeg 浏览器智能体:如何让 AI Agent 读取并操作网页的完整指南 2026/9/25 22:25:17

Codeg 浏览器智能体:如何让 AI Agent 读取并操作网页的完整指南

Codeg 浏览器智能体:如何让 AI Agent 读取并操作网页的完整指南 【免费下载链接】codeg Collaborative multi-agent AI coding workspace: aggregate sessions from Claude Code, Codex, OpenCode, Pi, Grok Build, etc. Desktop app, self-hosted server, or Docke…

阅读更多 →
Atlas 300V 24G部署YOLO全攻略:从模型转换到推理调优 2026/9/25 22:24:18

Atlas 300V 24G部署YOLO全攻略:从模型转换到推理调优

1. 先搞清楚:Atlas 300V 24G到底是不是一张“运算加速卡”服务器到货那天,我做第一件事不是急着装系统,而是先插上一块全新的计算卡。卡身上的印刷体小字写得很克制:Atlas 300V 24GB。随后我打开终端敲了一句npu-smi info&#xf…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉