> 新闻 > 国内新闻 > 正文

x战警

谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

古剑奇谭

A |     IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。     8 月 25 日消息,华硕 ROG Xbox Ally X20 掌机现已在海外市场开启预订,新品配备 7.4 英寸 OLED 屏幕,配备 AMD 锐龙 AI Z2 Extreme 处理器、24GB LPDDR5X 内存,单机身建议零售价 1,299.99 美元(注:现汇率约合 8,760 元人民币)。         IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。据介绍,这款掌机采用半透明外壳,看起来非常有辨识度。

B | 正面配备 7.4 英寸 OLED 面板,支持 120Hz 高刷,HDR 峰值亮度可达 1400nits,分辨率为 1920*1080。         但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。         谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。         GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。

C | 规格方面,这款掌机配备重新设计的 PCB,搭载 AMD 锐龙 AI Z2 Extreme 处理器,配备 24GB LPDDR5X-8000 内存,内置 1TB M.2 2280 固态硬盘,支持后期升级。         GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。

D | 同时,这款掌机的十字键采用锅仔片结构,触感更加清脆。         训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。摇杆升级 TMR 方案,死区约为 3%,相比传统方案能够提供更高的精准度。值得注意的是,这款掌机取消了 microSD 卡槽,改用 microSD Express 存储卡,传输速率可达 1GB/s,可以用更快的速度载入大型游戏。

E | 此外,华硕还为 ROG 铁杆粉丝准备了 Xbox Ally X20 套装版。

F |          泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。这款产品囊括 Xbox Ally X20 掌机、ROG XREAL R1 Edition 20 AR 眼镜、dbrand Killswitch 保护壳及屏幕贴膜、dbrand 摇杆帽、68W 充电器和专属收纳箱,定价 2,499.99 美元(现汇率约合 16,847 元人民币)。         性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。

G |          参考。

Current article:http://www.diaoengngtengdiachanpiezao.sbs/news/20260826_480955.docx

Published on:08:37:17