欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。
新鲜AI产品点击了解:https://top.aibase.com/
1、字节推语音生成模型Seed-TTS 擅长感情控制,声音与真人无异
这篇文章介绍了字节跳动团队提出的新型语音生成模型Seed-TTS,该模型基于自回归Transformer架构,具有极高的语音质量和表现力,难以区分与人类语音的差异。它在情感控制、小说配音和跨语言内容创作等方面表现出色,通过自我蒸馏和强化学习技术提升了发音的自然性和可控性。Seed-TTS在语音合成领域带来了显著进展,为未来的语音合成技术开辟了新的可能性。
2、Stability AI发布AI音频模型Stable Audio Open
Stable Audio Open是Stability AI推出的开源文本转音频模型,可生成长达47秒的音频样本和音效,适用于音乐制作和声音设计。用户可以创建鼓点、乐器乐段、环境声音等音频元素,支持音频变化和风格转换。模型提供了稳定的音频生成质量和长度,用户可根据自定义音频数据微调模型,提高生成音频的质量和可控性。
3、Suno新功能被Udio抢跑 上传任意音频Udio自动帮延长创作
这篇文章介绍了Suno原本计划推出的新功能被竞争对手Udio抢先发布的情况。Udio推出了一系列更新,帮助用户上传音频片段并自动解析旋律和和弦,创作出美妙的音乐,并提供了多项便利功能。
4、腾讯混元发布开源文生图大模型混元DiT加速库
腾讯混元发布了针对开源文生图大模型混元 DiT 的加速库,可将推理时间缩短75%,生图时间大幅缩短。用户可通过三行代码调用模型,无需下载原始代码。腾讯混元表示将继续优化混元 DiT 的开源生态,共建视觉生成开源生态,推动大模型行业发展。
5、MiGPT项目:将小爱音箱接入ChatGPT和豆包
MiGPT项目将小爱音箱、米家智能设备与ChatGPT技术相结合,创造智能贴心的家庭助手,实现家庭自动化并建立情感联系。项目主要亮点包括LLM回答、角色扮演、流式响应、长短期记忆、自定义TTS和智能家居Agent。项目提供两种启动方式以适应不同用户需求,配置参数需用户自定义以确保连接正常。
6、猿辅导旗下 AI 设计工具 Motiff 妙多全球发布
Motiff 妙多是一款定位为 AI 时代设计工具的界面设计软件,通过 AI 技术优化设计流程,提高生产效率,为用户带来前所未有的设计体验。该软件带来多项创新,包括 AI 复制、AI 布局、AI 设计系统创建、AI 设计系统维护、AI 一致性检查等多个 AI 功能,是国内首个自研图形渲染引擎的界面设计软件。
7、即梦全量上线实时画布功能
即梦宣布全量上线实时画布功能,用户可以通过简单涂抹形状并添加提示词定制图像,让AI画图更可控。保存为新图层后可继续优化,定稿后保存为图片。
8、谷歌AI概览功能触发频率大幅下降
谷歌的人工智能概述现在只在不到15%的查询结果中显示,与过去84%的情况相比发生了显著变化。人工智能在搜索结果中的呈现方式经历了调整,以提高搜索质量。文章指出人工智能在搜索中的作用不断演进,虽然概述功能减少,但人工智能在搜索中的应用是不可避免的变化。
9、研究人员开发出能识别运动员情绪的人工智能
研究人员利用计算机辅助神经网络成功从网球运动员的肢体语言中准确识别出情绪状态,展示了人工智能在情绪识别方面的潜力。然而,这项研究也引发了伦理问题,需要明确相关法律和道德问题。
10、Ouroboros3D:通过3D感知实现图像到3D的生成
Ouroboros3D是一个集成了多视角图像生成和3D重建的统一3D生成框架。通过递归扩散过程,实现了从图像到3D的生成。研究人员提出的这种新方法具有多个优点,包括生成更多样化和真实的视角图像,减少噪声和失真,提高生成效率。实验证明Ouroboros3D生成的3D模型具有更好的细节和准确性,接近真实的3D场景。
11、Mobile-Agent-v2:让AI学会自动刷手机
Mobile-Agent-v2是一个先进的AI系统,通过多代理协作架构实现对移动设备的全面控制,提高任务完成率30%以上。该系统能够自动化完成搜索购买商品、邮件发送、导航设置和视频观看等任务,为用户带来更多便利。
12、美国监管机构将对微软、OpenAI和英伟达展开反垄断调查
这篇文章报道了美国司法部和联邦贸易委员会达成协议,将针对微软、OpenAI和英伟达展开反垄断调查。监管机构对人工智能产业的关注度显著提高,反映出AI行业的重要性和影响力。