
A | 日报讯(见习记者王晶晶)不用手动填表、无需长时间等待,站在AI智能体“小新”面前说一句“请帮我办理营业执照”,按提示上传关键材料,企业营业执照即可申领完成。

B | IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。 IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。 但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。这是在石家庄高新区政务服务大厅里发生的一幕。

C | 8月17日,石家庄薇玖信息技术有限公司经办人董红璇作为AI智能体“小新”的首批服务对象,实地体验了它的高效和便捷。 谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。

D | 按照语音提示上传材料之后,AI自动识别并抓取身份证件、住所证明等核心信息进行填报,几分钟就完成了企业设立登记申请。“真没想到,机器人能自动填表格。”董红璇说。企业设立登记申请涉及名称申报、人员信息核验、经营范围勾选、住所证明提交等环节,申报材料多、重复填表是长期痛点。

E | GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。 GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。 训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。 泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。

F | 石家庄高新区行政审批局依托人工智能大模型技术,上线AI智能体“小新”,辅助企业快速办理营业执照。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。不同于传统问答式智能客服,“小新”最大的本领是“帮办”业务。它可以通过语音对话和智能引导,自动采集数据、生成申请材料。企业经办人只需按照语音提示,将人员身份证、住所使用证明等关键材料拍照上传,“小新”即可抓取姓名、身份证号、注册地址等核心信息,自动进行逻辑校验、自动填入申报系统,输出规范材料,等待生成执照。如此一来省去了过去动辄半小时以上的填写流程。石家庄市高新区行政审批局商事登记工作组负责人杨斌淇介绍,AI智能体减少了人工核验负担。比如身份信息采集,以往需人工反复录入十多次,现在“小新”一次采集、多次复用;企业经营范围填报,过去经办人需在数千条目中反复点选、上下翻找,现在“小新”能根据企业描述实现智能匹配。据介绍,石家庄高新区将推动AI服务向企业变更、备案、注销等全生命周期中的需求延伸,持续提升政务服务智能化、精细化水平。

G | 性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。

H | 参考。
Current article:http://hvx4v.zeitujiangshaopen.pics/0dgpn/20260826/53911.html
Published on:21:34:56
道交法修订草案拟调整电动自行车限速
深圳西丽高铁枢纽建设迎新进展 既有地铁线间施工获突破,深圳西丽高铁枢纽建设迎新进展 既有地铁线间施工获突破
网站数据自动备份:一个脚本+一个计划任务搞定
提升我国低空经济产业链韧性和自主可控水平
全国体操团体锦标赛:浙江再揽女团冠军
台女星穿黑色透视装用"美人计" 男演员直言本色出演