武当休闲山庄 - 稳定,和谐,人性化的中文社区

查看完整版本: [-- 免费 AI “神器”系列第三弹：AI 视频领域的“字节跳动”诞生，首个GPT-4V盲测工具发布 --]

武当休闲山庄 -> 数码讨论 -> 免费 AI “神器”系列第三弹：AI 视频领域的“字节跳动”诞生，首个GPT-4V盲测工具发布 [打印本页]

登录 -> 注册 -> 回复主题 -> 发表主题

huozm32831

2024-02-13 16:26

近期，生成式人工智能（AIGC）领域又涌现出多款创意十足的新应用。

今天，钛媒体AGI梳理了免费 AI “神器”系列第三弹，共五款，其中大多数实用工具能帮你提升一定的生产力。

AI视频编辑神器——Runway Gen-2
胸部x光片诊断神器——CheXagent
AlphaZero升级版——DeepMind下象棋模型
Vision Arena：视觉模型盲测工具
图片3D转换器——ComfyUI 3D Pack
1、AI 视频编辑神器——Runway Gen-2
产品信息：Runway Gen-2是一款功能强大的AI视频编辑软件，用户可以直接使用“文本”、“图片”和“文本+图片”三种方式提示生成视频内容，并自动剪辑视频。

产品功能：用户在主界面可自由选择“文本”、“图片”和“文本+图片”三种方式来生成视频内容。以“文本”生成视频为例，在输入框输入一段描述词后，等待两分钟左右就会生成一段4秒的视频内容。

除此之外，Runway Gen-2还配备有其他30种强大的 AI 工具，比如：“Remove Background”（绿幕去背景）、“Expand Image”（图片扩展）、“Blur Faces”（模糊人脸）、“Inpainting”（移除视频杂物/人）等，可以帮助视频内容创作者极大提高工作效率。

Runway Gen-2配备有30种 AI 功能

据悉，Runway Gen-2背后的开发团队来自Runway公司，他们致力于开发用于生成视频、图像和多媒体内容的产品和模型。在2023年6月，该公司以15亿美元的估值，完成了1.41亿美元的C轮融资，谷歌、英伟达等科技巨头都参与了投资，被誉为“AI 视频生成领域的字节跳动”。

Runway Gen-2首席执行官Cristobal Valenzuela曾表示，“创意软件的时代已经结束。”而有科技博主认为：“如果（Runway）按照这个速度发展下去，到2024年底，我们或许能够看到导演们手工制作出好莱坞水准的生成式视频作品。”

体验链接：https://app.runwayml.com/

2、胸部x光片诊断神器——CheXagent

产品信息：CheXagent是一个专门用来解读胸部x光片的AI模型，旨在提高医疗影像诊断效率与准确性。

产品功能：用户只需在CheXagent主界面上传一张胸部x光片，等待数秒后即可生成相关的诊断结果，包括疾病识别、异常检测、重要结构分析以及后续步骤建议。

CheXagent 界面

CheXagent由斯坦福大学与Stability AI合作开发，结合了临床医学大语言模型、视觉编码器和视觉-语言桥接网络，利用超过600万组数据的大型集合进行训练，提升了解读X光图像的能力。如若未来进入大规模应用，医疗工作者的工作效率和诊断准确率都将得到提升。

体验链接：https://stanford-aimi.github.io/chexagent.html

3、AlphaZero升级版——DeepMind下象棋模型

产品信息：Google DeepMind抛弃传统的搜索方法，使用Transformer模型，训练了一个AI模型来下国际象棋。

产品功能：Google DeepMind下象棋模型使用了一个国际象棋程序Stockfish 16来训练，AI不再需要像此前普通 AI 国际象棋依赖于搜索算法来预测和评估最佳选择的走法，而是直接学习成千上万棋局中的模式和策略，达到只需通过观察当前棋盘的状态，做出高水平决策的大师级棋艺。

DeepMind下象棋模型相关论文

该模型在性能上超越了AlphaGo Zero和GPT-3.5-Turbo-Instruct，证明了深度学习模型，特别是Transformer模型，能够在复杂的决策和策略游戏中学习和模拟高级人类智能，显著减少了计算需求，为AI的自主学习和理解复杂系统提供了新的范例。

与AI下棋体验地址：https://lichess.org/

4、Vision Arena：视觉模型盲测工具

产品信息：Vision Arena是一款视觉模型领域的开放评测对比平台，目的是测试和比较不同的视觉语言模型（VLMs），比如GPT-4V、Gemini（谷歌模型）、Llava、Qwen-VL（通义模型）等。

产品功能：用户可以在Vision Arena工具上同时测试两个视觉模型，并对它们进行投票，以决定哪个更优秀。而且整个过程处于“盲测”状态，需要选择你认为好的结果才会告诉你模型是什么。

据透露，这是全球首个GPT-4V的盲测工具软件。未来，基于该工具的模型基准排行榜（Elo Rating）功能也将推出。

体验地址：https://huggingface.co/spaces/WildVision/vision-arena

5、图片3D转换器——ComfyUI 3D Pack

产品信息：ComfyUI 是一款基于稳定扩散模型（Stable Diffusion Model）架构技术，直观、功能强大且实现模块化的图形平台，允许用户创建复杂的 AI 文生图工作，无需编程知识。

产品功能：今年1月，ComfyUI 宣布引入3D图像处理模型，能快速将图片转换成3D模型。如今，用户可在ComfyUI 3D Pack平台上将图片快速转换成一个3D模型，并能从不同角度查看该3D模型，还能使用3D高斯扩散技术提升模型质量，让3D模型看起来更加真实和具有立体感。此外，ComfyUI 3D Pack还支持多种格式导出，集成了先进的3D处理算法。

jjybzxw

2024-02-13 17:47

我很高兴地向您介绍最新产品——AI视频领域的“字节跳动”和首个GPT-4V盲测工具。这两个产品都是免费AI“神器”系列的第三弹。

1. AI视频领域的“字节跳动”：

我们很高兴地宣布，我们推出了全新的AI视频处理工具，它可以帮助您轻松地处理视频文件，实现各种效果，包括视频压缩、分辨率调整、视频转GIF等。这个工具的灵感来源于字节跳动公司的成功经验，我们希望它能为您带来同样的便利和乐趣。

2. 首个GPT-4V盲测工具：

我们还推出了首个GPT-4V盲测工具，这是一个基于人工智能的文本生成工具。通过使用这个工具，您可以生成各种类型的文本，包括文章、报告、故事等。此外，这个工具还具有自动摘要、翻译等功能，可以帮助您更高效地处理文本内容。

以下是免费AI“神器”系列第三弹的主要特点：

1. AI视频处理工具：

- 视频压缩：支持多种视频格式，轻松压缩视频文件，节省存储空间。
- 分辨率调整：根据您的需求调整视频分辨率，适应不同的播放设备。
- 视频转GIF：将视频文件转换为GIF格式，方便在社交媒体上分享。
- 视频剪辑：支持视频剪辑功能，轻松截取视频片段。

2. GPT-4V盲测工具：

- 文本生成：输入关键词或短语，自动生成符合要求的文章、报告或故事。
- 自动摘要：对长篇文章进行自动摘要，提炼关键信息。
- 翻译功能：支持多种语言的翻译功能，方便您处理外语文本。

我们始终致力于为您提供更好的AI工具和服务，希望这个免费AI“神器”系列第三弹能为您带来更多的便利和乐趣。如果您有任何问题或建议，请随时与我们联系。谢谢！

查看完整版本: [-- 免费 AI “神器”系列第三弹：AI 视频领域的“字节跳动”诞生，首个GPT-4V盲测工具发布 --] [-- top --]

Powered by www.wdsz.net v8.7.1 Code ©2005-2018www.wdsz.net
Gzip enabled