首页 文章 精选 留言 我的

精选列表

搜索[AB实验平台],共10000篇文章
优秀的个人博客,低调大师

李飞飞旗下 AI 实验室 World Labs 发布 Atlas:从几张照片重建 3D 世界

李飞飞创立的 World Labs 发布了 Atlas,一个从零预训练的多模态空间智能大模型。你可以给它几张照片,它能生成从任意角度观看的连续视频;给它一段手机拍摄的视频,它能重建出完整的 3D 场景,让机器人在里面模拟导航。 核心架构是「multimodal autoregressive diffusion transformer」——这个术语拆开来看,autoregressive 意味着它像 LLM 一样逐个 token 生成,diffusion 意味着这些 token 通过扩散模型解码为像素。关键区别在于,它的输入不是纯文本,而是「空间上下文」——每张图片被锚定在一个 3D 位置,用相机位姿而非文字描述来控制视角。 技术细节上,Atlas 能做四件事。 相机控制生成:1 到 6 张输入图,生成最长 1 分钟、1440p 的视频,像素级精确控制相机移动。 空间重建:1 到 100 多张图片,输出新视角和显式 3D 表示(点云、3D Gaussian splats)。 时空模拟:仅需 3 个手机摄像头就能重塑视频(bullet time 效果),支持 Real-to-Sim 机器人工作流。 还有文本到图像和 360 度全景图生成。 官方给的 benchmark 数字很漂亮。在人类评分偏好测试中,Atlas 对主流模型全面领先:Flux 3 93% 的人选 Atlas,Seedance 2.5 是 94%,Gemini Omni Flash 是 81%。3D 重建的绝对相对误差 8.6,低于 Pi3X(11.1)和 VGGT-Ω 1B(9.7)。但这些都是自报数据,和所有未发布模型的 benchmark 一样,需要独立验证。 社区里的讨论比数字本身更有意思。teraflop 点出了一个关键问题:Atlas 真正的价值可能不在生成图像,而在它学到的东西——比如识别「地面可以走」这种语义知识,用来做机器人路径规划。一位叫 JohnnyAPI 的 World Labs 客户反驳说,公司可能依赖预置的 3D 资产,这会削弱模型的语义深度。 World Labs 联合创始人 Justin Johnson 在回复中对「世界模型」做了解释。他把这类系统分成三级:渲染器、模拟器、规划器。Atlas 目前「介于渲染器和模拟器之间」——能生成高质量 3D 视图,但还不能模拟物理交互。这个定位很诚实,和那些「AGI 已经来了」的叙事风格完全不同。 另一个值得注意的细节来自 smusamashah 的观察:在演示的多米诺骨牌场景中,「骨牌凭空出现又消失」。Johnson 承认时间一致性是目前的主要局限,场景中时间基本冻结,偶尔有微弱的波浪动作。这表示 Atlas 本质上是空间模型,而非时空模型。 评论区也暴露了 AI 领域一个老问题:大部分人用不上。pj_mukh 的留言就四个字:「Please give us access.」Atlas 目前仅对合作伙伴开放早期访问。有人问帧率能否支持实时应用,官方没有给出具体数字。 但要说 Atlas 最让人兴奋的地方,可能是 stranded-man 提的一个问题:如果给地球上所有照片加上地理标签,能不能建出整个世界的 3D 模型?Atlas 项目负责人 Keunhong Park 的回答是:理论上可行,通过巧妙的上下文管理可以实现。这不只是技术问题,这是对世界建模方式的重新定义——从「人工建模」到「从照片中自动涌现」。 参考来源: Atlas: A World Model for Spatial Intelligence — World Labs HN discussion

优秀的个人博客,低调大师

缪斯实验室推出十元级 RISC-V 开发板 nanoCH32V003

MuseLab 推出最新的 RISC-V 开发板 nanoCH32V003,这款板子基于沁恒 CH32V003F4U6 芯片,拥有板载 24M 晶振、复位按键、LED 指示灯,且引出所有 IO 口,提供 TYPE-C USB 供电,支持 SWDIO 单线下载调试。 板子参数: 实拍: 这个板子需要使用 SDI 接口(1-wire 串口调试接口)的 WCHLink-E 编程器,相关信息请参阅WCH 网站上的 WCH-Link 调试器文档。使用教程和烧录教程可以在 GitHub 仓库中查看。 这款新板子的功能和接口类型有点少,但毕竟是售价个位数的“超轻量级开发板”,这个价格还要啥自行车。

优秀的个人博客,低调大师

MIT的实验室里,诞生了一个《惊魂记》版AI精神病患者

不知道你有没有看过希区柯克的电影《惊魂记》。整部电影弥漫着惊悚和恐怖的气息,直到结尾,你还不得不接受来自精神分裂的汽车旅馆老板Norman的诡异凝视。 这绝对是文摘菌看过的恐怖电影之最 如果Norman是个AI,会不会更令人毛骨悚然? MIT最近做了这样一个心理变态AI,还受《惊魂记》影响,给AI取名为Norman。 怎么个变态法? 先说一般的AI。给AI看一些图片,AI可以给图片做个标注,告诉你图片里有什么,类似于看图说话。就像下面这样: AI能识别出图片里的“飞机”,是因为你给它看了很多飞机的图片。但是如果你让这个AI“看”过的,只有打架、枪击、战争的照片,AI会不会认为图片里的飞机是过来投炸弹的? 答案是:会。 MIT Media Lab整出来的这个名叫Norman的AI,是用Reddit上的图像数据训练出来的。看到任何图片,Norman都

资源下载

更多资源
Mario

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长,特征是大鼻子、头戴帽子、身穿背带裤,还留着胡子。与他的双胞胎兄弟路易基一起,长年担任任天堂的招牌角色。

腾讯云软件源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题,腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构,目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称,一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集,帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Rocky Linux

Rocky Linux

Rocky Linux(中文名:洛基)是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版,作为CentOS稳定版停止维护后与RHEL(Red Hat Enterprise Linux)完全兼容的开源替代方案,由社区拥有并管理,支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性,采用模块化包装和SELinux安全架构,默认包含GNOME桌面环境及XFS文件系统,支持十年生命周期更新。

用户登录
用户注册