✨ 1: Translation Agent
Translation Agent 吴恩达老师开源翻译工作流Agent
Translation Agent 是一个基于反思工作流程的机器翻译系统的Python示范。其主要步骤包括:
使用大语言模型(LLM)将文本从source_language
翻译到target_language
;
让LLM反思这次翻译并提出改进建议;
依据这些建议改进翻译。
Translation Agent 是一个探索性项目,尚未成熟,旨在通过开放讨论、实验、研究和开源贡献来推动机器翻译领域的进步。
地址:https://github.com/andrewyng/translation-agent
✨ 2: MimicBrush
MimicBrush 阿里巴巴开源无需训练即可使用参考图像编辑图像的工具
MimicBrush是一种零样本图像编辑工具,通过参考图像进行模仿编辑,帮助用户更方便地进行创作。该工具的核心在于用户只需指定源图像中的编辑区域(用白色蒙版标出),并提供一张预期编辑效果的参考图像。MimicBrush能够自动捕捉两者之间的语义对应关系,并在一次操作中完成编辑。
具体来说,MimicBrush通过在视频剪辑中随机选取两帧图像,一帧作为参考图像,另一帧作为源图像,对源图像的某些区域进行蒙版处理,然后使用参考图像中的信息来恢复这些蒙版区域。在训练过程中,它采用了生成训练框架进行自监督学习,使其能够在不同图像间捕捉语义对应关系。
实验结果表明,MimicBrush在各种测试案例中表现出较高的有效性,并且相较于现有的替代方案具有显著的优越性。研究人员还构建了一个基准来促进进一步的研究。
该工具展示了一系列多样化的编辑结果,包括局部区域编辑、纹理转移和后期处理优化等功能。MimicBrush的开发团队来自香港大学、阿里巴巴集团和蚂蚁集团。
地址:https://github.com/ali-vilab/MimicBrush
✨ 3: Whisper Web
Whisper Web 是一个在浏览器中运行的机器学习语音识别项目。
Whisper Web 是一个基于机器学习技术的网页端语音识别工具,使用 🤗 Transformers.js 构建。它可以直接在浏览器中进行语音识别,无需安装额外的软件。
实时字幕生成:可用于在线会议、网络直播等场景,实时生成字幕,提高内容可访问性。
语音搜索:在网页端实现语音输入搜索,提升用户体验。
语音智能助手:结合网页应用开发智能语音助手,提供互动性更强的用户服务。
语音笔记:在浏览器中直接将语音转换为文本,方便会议记录和笔记整理。
地址:https://github.com/xenova/whisper-web
✨ 4: Stable Diffusion 3 Medium
Stable Diffusion 3 Medium 开源的先进文本生成图像模型
Stability AI开源了Stable Diffusion 3 Medium模型,这是一个文本到图像生成模型,具有20亿个参数,能够在消费级PC和笔记本电脑以及企业级GPU上高效运行。该模型在图像质量、复杂提示理解和资源效率方面有显著提升,具有Photorealism、Prompt Adherence、Typography等独特特性。模型使用多模态扩散变压器技术,训练数据包括10亿张图像和大量精调数据。可以通过Stability平台上的API和Stable Artisan注册免费试用。
模型地址:https://huggingface.co/stabilityai/stable-diffusion-3-medium
地址:https://stability.ai/news/stable-diffusion-3-medium
✨ 5: SF-V
SF-V是一种通过单步生成高质量视频的新方法,显著降低计算成本。
SF-V(Single Forward Video Generation Model)是一种单步视频生成模型,旨在通过对预训练视频扩散模型进行对抗训练以优化视频生成过程。传统的基于扩散的方法需要多个去噪步骤,计算成本较高。而SF-V通过对抗训练,使多步视频扩散模型(如SVD)能够通过单次前向传播生成高质量视频,同时捕获视频数据中的时间和空间依赖关系。
地址:https://snap-research.github.io/SF-V/
更多AI工具,参考国内AiBard123,Github-AiBard123 公众号:每日AI新工具