查看: 85559|回复: 321
打印 上一主题 下一主题

谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

[复制链接]
跳转到指定楼层
楼主

九品芝麻官

谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

初代吸血鬼

A |     

    
      雷霆球星杰伦·威廉姆斯正在进行中国行活动。

B |     IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。         IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。美女记者周玲安晒出与杰伦·威廉姆斯一起出席活动的视频,并配文写道:“杰伦·威廉姆斯首次向球迷展示,45分钟的真实NBA训练,现场惊现中国版‘亚历山大’和球迷互动单挑杰威在专访中告诉我,身体恢复得很好,下赛季剑指总冠军。         但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。

C |          谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。

D |          GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。         GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。         训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。         泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。

E | 论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。         性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。         参考。

Current article:http://7hpy9b.caihezhehuagenshun.sbs/news/20260826_496.html

Published on:09:30:59


点击获取礼包
沙发
发表于 03:48:42 | 只看该作者
银 雷霆扫毒 安娜情欲史
板凳
发表于 16:49:20 | 只看该作者
女超人 在这世界的角落 无证之罪
地板
发表于 12:22:42 | 只看该作者
七侠五义 非诚勿扰 假如生活欺骗了你
5#
发表于 22:39:09 | 只看该作者
长发公主 血战太平洋 私人订制
6#
发表于 04:21:19 | 只看该作者
谍影重重 魂 离婚协议
7#
发表于 16:34:19 | 只看该作者
新宿天鹅 钱塘老娘舅 中国有嘻哈
8#
发表于 20:17:11 | 只看该作者
黑白迷宫 终结者2 死亡笔记
9#
发表于 13:47:40 | 只看该作者
大和抚子 英雄 康熙来了
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

我的网站是互联网最大的搜索引擎优化研究中心,是致力于培养学员用户体验意识和提供专业技术解答的专业培训机构, 成立于2007年,2008年第一家入驻歪歪的培训机构,2014年成为腾讯课堂战略合作机构。
© 2007-2016 我的网站 湘ICP备13004652号-1 Powered by Discuz!X Template by 我的网站 
快速回复 返回顶部 返回列表