首页 文章 精选 留言 我的

精选列表

搜索[LLM辅助],共9929篇文章
优秀的个人博客,低调大师

面部识别辅助监控系统 人工智能为城市安全保驾护航

安全摄像头也在提升人工智能技术。英特尔在4月宣布,它已经为安全摄像头生产了硬件,能够“密集监测、立体视觉、人脸识别、计数”和“行为分析”。该网站称,另一款名为DNNCam的相机是一款深度学习摄像头,它具有防水、自给自足的功能,而且号称“几乎不可摧毁”,这意味着它可以在远离互联网连接的偏远环境中工作,也可以在收银台后面进行“老客户识别”。 当人工智能接管城市监管,面部识别让犯罪分子无处影遁,人工智能的实际应用已经远远超过了我们人类的预想,在贴近人们的吃、穿、住、行等方面,人工智能已经渐渐变得我们都离不开了,而面部识别和人工智能的发展和应用是未来发展的大潮流之一,但是应用前这些技术还需要进一步的成熟,这样才能保证好技术不会产生坏影响。 现在在全球任何一个大城市,监控摄像机都是随处可见的。以北京这个特别的地方为例,至少有三个政府部门的监控摄像机在持续工作。最常见的治安监控,就是街头巷尾像路灯一样的小型摄像机。这种摄像机带云台,可以旋转,一般由警察部门负责,作用是监控日常治安。红路灯上方安装的枪形摄像机,主要负责拍摄车辆和行人违章,高速公路、快速路上依托横杆安装的枪形摄像机一部分还包含了测速功能,这些由交通警察部门负责。 除此以外,还有一种安装位置非常高,像路灯杆形状的摄像机,一部分属于交通管理部门,主要用途是监控交通流量。这些摄像机近几年来经过“智慧城市”等等项目的升级,可以拍清楚人脸和车牌,也就是说,不管是行人、车辆还是非机动车,总有不同的摄像机会拍到你。 这一切从伦敦开始。伦敦是世界上第一个CCTV化的城市。而它的第一个固定监视系统在1968年启用,安装在美国驻英国大使馆附近的格洛夫纳广场,用以监控抗议越南战争的学生。在这之后,监控系统被用在更多的地方。1993年,闭路相机监控帮助侦破了一起命案:男孩詹姆斯·伯格在英格兰西北部一家购物中心失踪而后被杀。监控录像显示,两名年纪更大的少年劫走了他。 根据监控录像,这两名少年被控谋杀,而詹姆斯·伯格在监控视频里的最后影像刺激了民众,闭路电视监控系统得到广泛支持。直到90年代末,基于“监控会防止犯罪”这个理论,英国内政部一半以上的预防犯罪预算都用在了建设监控摄像头上。 从覆盖密度上来看,英国已经成了全球摄像头最密集的国家,全境的街道和公共区域有400-590万台监控摄像头,平均每一个摄像头盯着11个英国人,每个人的脸每天会被闭路电视拍摄300次。2015年的数据显示,伦敦有超过42万个监控摄像机,位居城市中的世界第二。第一名是北京,媒体在2015年以正面角度报道,称北京城区已经实现了监控100%覆盖,摄像机数量超过了47万个。 随着图像处理和人工智能技术的快速发展得到了解决。不仅对视频进行“存储”,并提取分析特征,进而形成结构化的可检索数据。视频的处理分析全部由系统自动进行,并智能提取相关特征信息,如车辆颜色、车牌号、车型,以及行人的年龄、性别和衣服颜色等。 “视频特征提取分析技术的最大优势就是帮助公安民警在海量的视频数据中,迅速找到有用的信息。比如,如果民警知道犯罪嫌疑人是一名40岁左右的中年男子,那么只要把‘40岁’、‘中年’、‘男’这几个特征输入系统,该技术就会把符合特征的视频片段全都检索出来,极大的提高效率和准确率。 本文转自d1net(转载)

优秀的个人博客,低调大师

当前的“LLM 智能”,是来自模型突破,还是工程堆砌?

编者按: 推理模型的"推理能力"飞跃,究竟是模型本身的进步,还是工程编排的巧妙包装? 我们今天为大家带来的这篇文章提出了一个尖锐的观点:所谓"推理模型"的突破,本质上并非模型智能的根本性提升,而是通过工具调用与流程编排对模型能力停滞所做的工程性补偿。 文章深入剖析了 GPT-5 等最新模型在执行任务时严重依赖 Python 沙箱、API 调用等外部工具的现象,揭示出大语言模型在代码生成与语义理解上的深层瓶颈。作者指出,OpenAI 正从基础研究转向应用变现,其推出的 ChatGPT Apps、Atlas 浏览器等产品,反映的不是技术突破,而是对模型能力停滞的策略性回避。文章进一步探讨了行业面临的两种路径选择:一是在现有架构上不断优化 pipeline 系统,追求短期收益;二是直面 Transformer 架构的根本缺陷,投入高风险、长周期的基础架构创新。 本文系原作者观点,Baihai IDP 仅进行编译分享 作者 | Mani Doraisamy 编译 | 岳扬 01 工具使用(tool use)是如何成为难题求解的替代方案 当 OpenAI 于 2024 年 4 月发布 o1,并称之为"推理模型"时,整个行业为之欢呼,认为这是一次重大突破。终于,AI 能够一步步思考、解决复杂问题,甚至处理研究生级别的数学题了。 但仔细观察其运行机制我们就会发现,当我们让最新模型 ChatGPT-5 计算两个大数的乘积时,它并不会自己进行计算,而是生成一段 Python 代码,在沙箱中执行后返回结果。相比之下,ChatGPT-3 至少还会尝试在内部完成算术运算(尽管常常出错),而 ChatGPT-5 则将计算任务外包给了外部工具。[注释1] 这种模式无处不在。所谓"Agentic AI"的自主性?无非是一连串的工具调用,比如网页搜索、API 调用、数据库查询。真正的突破并不在于模型本身的智能水平,而在于协调外部系统的编排层。从推理能力到 Agentic AI,一切都不过是代码生成的高级应用。 这些能力并非模型本身的进步,而是为停滞不前的模型能力所设计的工程层面的变通方案。 这一点至关重要,因为整个 AI 行业(从数万亿美元的 GDP 预测到独角兽公司的估值[1])都建立在模型能力持续进步的预期之上。而我们实际得到的,却是越来越复杂的"pipeline 工程",其底层基础却早已陷入停滞。 02 GPT-5:皇帝的新推理(不是"衣服"😏 2025 年 8 月本该是一场胜利。OpenAI 曾承诺"将博士级智能装进每个人的口袋",然而他们交付的成果在代码生成这一核心能力上几乎停滞不前 ------ 而其他能力都依赖于此。这正是瓶颈所在:代码生成是交通枢纽。更好的代码 → 更强的推理(通过工具执行)→ 更优的智能体 → 更高的生产力 → 万亿美元级市场。 一旦这个交通枢纽停滞,整条链条便随之停摆。 使用 AI 编程工具的开发者们明显感到了失望。基于 OpenAI 模型构建 AI 编程工具的公司(如 Cursor、Replit)曾押下数十亿美元,赌定每次模型发布都会带来指数级的进步。GPT-5 却打破了这一预期,而这本不该发生。从 GPT-3 笨拙的算术能力,到 GPT-4 生成连贯代码的能力,进步似乎势不可挡。整个行业正是建立在对持续进步的预期之上。但在过去一年里,这种进步明显停滞了。 03 从研究实验室到应用商店 与此同时,OpenAI 正将重心从模型研究转向应用开发。只需观察 OpenAI 在过去几个月的轨迹,这一趋势便已显而易见: 2025 年 10 月 6 日:ChatGPT Apps 上线 第三方应用可直接在 ChatGPT 内运行。通过 Expedia 预订航班,在 Canva 中设计图像,浏览 Zillow 上的房产信息,全程无需离开聊天界面。Apps SDK 为开发者开放了 8 亿用户生态。这标志着 OpenAI 正在变成一个应用商店。 2025 年 10 月 21 日:Atlas 浏览器发布 这是一款由 AI 驱动的新型网页浏览器,意在挑战 Chrome 的主导地位。该产品具备浏览器记忆、智能体模式,以及集成于浏览器的全链路 AI 助手。这标志着 OpenAI 正在转型为一家消费级产品公司。 他们正逐步从研究领域转向技术应用: 推理模型(贴近最前沿、最基础的核心研究) 带工作流构建器的 Agentic AI(离核心研究距离更远了) ChatGPT Apps(纯粹的生态运营) Atlas 浏览器(将 ChatGPT 深度嵌入浏览器) OpenAI 的每一步都在远离"如何构建更优模型",迈向"如何将现有模型变现"。 04 关于 OpenAI 转型动因的两种解读 为何这家全球顶尖的 AI 实验室会从技术研究转向应用领域?现有两种主流解释。 解读一:遭遇技术瓶颈却秘而不宣 规模扩张已然失效。尽管投入数十亿美元的算力资源和全球顶尖的研究人员,模型质的飞跃却难再现。模型并未变得更智能,只是更擅长协调外部工具。 与其承认"无法突破模型性能瓶颈",不如转向变现赛道。ChatGPT Apps 无需技术研究实现突破即可创收,浏览器生态不依赖 GPT-6 就能构建用户壁垒。在摸索下一步方向时,应用业务能为他们争取缓冲时间 ------ 当然,这是一种悲观的解读:将技术进步的停滞包装成战略转型。 解读二:应用赛道的利润更丰厚 训练尖端模型耗资数十亿、历时数载,而基于现有模型开发应用成本低、见效快。后者利润空间更大,风险更低,变现路径更清晰。 或许 OpenAI 经过理性测算,发现应用开发能以更小投入获取更大回报,因而调整资源分配。既然六个月就能打造浏览器,何必耗费 50 亿美元训练 GPT-6?这是从现实主义的视角进行解读:利润空间优先于技术进步。 这两种解读可能都部分正确。但无论如何,结果殊途同归:当整个生态系统最需要突破时,领头羊却减少了对基础模型研发的投入。 05 没人愿面对的架构问题 工具编排(Tool orchestration)确实是令人印象深刻的工程成果。协调网页搜索、代码执行、数据库查询和 API 调用,需要复杂的软件架构。能够管理复杂工作流的智能体框架也的确具备实际价值。但这些都并未回答一个根本问题:模型为何从一开始就离不开工具? 早期模型如 GPT-3 曾饱受词元碎片化(token fragmentation)的困扰(例如将 "strawberry" 拆成 "straw" 和 "berry",而后者含义完全不同)。现代分词器已缓解了这一问题,但更深层的架构缺陷依然存在:大语言模型仍然缺乏真正的语义理解能力。这类语义问题在代码生成中尤为致命,因为代码对精确性要求极高。 当模型产生幻觉,或在长上下文中丧失连贯性时,引入网络搜索功能并不能根除病灶。固定维度的嵌入(embeddings)会有损地压缩语义信息,注意力窗口则对上下文施加了硬性边界。这些都是架构层面的限制,而非工程问题。 这就好比在一座仅能支撑三层楼的地基上建造摩天大楼。你可以不断加固结构、重新分配承重、安装精密的支撑系统,但最终,你需要的是一个全新的地基。无论围绕现有地基做多少精巧的工程优化,都无法让你建得更高。 06 行业必须面对的抉择 整个行业站在十字路口,尽管多数参与者仍在回避这个现实。 路径一:持续优化 pipeline 系统 延续当前轨迹:略微扩大模型规模,优化工具协调机制,深化与应用平台的整合。推出浏览器与应用商店,构建更完善的智能体框架,在既定架构限制下进行工程优化。 这条路径能带来可预测的短期收益。对许多尚未达到 AI 编程工具智能水平的领域而言尤其如此。由于 AI 编程工具最初是由开发者为自己打造的,他们深刻理解问题所在,并知道如何解决。类似的进步将在其他领域陆续出现,风险投资的资金流仍会持续一段时间。但 a16z 预测的 3 万亿美元 GDP 增长,其前提是生产力翻倍,而不是像当前 AI 编程工具那样仅停在约 20% 的提升水平。要实现突破,必须承认现有基本方法已遇阻。 路径二:承认我们需要全新的基础架构 承认模型规模扩大已触及天花板,投入能解决根本问题的架构创新。这意味着: 采用基于图结构的架构,保留结构化关系,避免分词造成的语义碎片化问题,根治 Transformer 架构的固有缺陷; 部署能高效处理长上下文的稀疏注意力机制; 借鉴生物神经组织原理的神经形态计算方案。 解决方案在于构建能保留信息而非有损压缩的架构。正如 AI 研究者 Andrej Karpathy 所言,现有模型只是"互联网的有损压缩"。真正的进步需要向无损表征迈进:保留原始信息中固有的组织形式、精确维护信息单元之间的具体关系、维护信息中概念的层级与从属关系。 这条路径成本高昂、前景未卜且进展缓慢。它要求我们直面现有路线的失败,且需要耗费数年的研究投入,且不保证成功。但这是唯一能真正解决问题而非回避问题的途径。 07 总结 目前,AI 编程工具市场正呈爆发式增长: Cursor:15 个月实现 5 亿美元年经常性收入(ARR),估值达 100 亿美元 GitHub Copilot:数百万用户,年收入达数亿美元 Windsurf:以 24 亿美元被收购 数十家初创公司正在融资,金额高达九位数 这一切都建立在同一个假设之上:模型在代码生成能力上将持续进步。如果这个假设是错的,整个市场就会变成一座纸牌屋 ------ 3 万亿美元的 GDP 预期将化为泡影,独角兽估值将失去支撑,生产力革命也将无限期推迟。 反之,谁若能解决底层架构问题,谁就将赢得一切。哪怕只是基础能力的小幅提升,也会在整个生态系统中产生连锁反应: 更优的代码生成能力 → 更强的推理能力(通过工具执行实现) 更强的推理能力 → 更强大的智能体 更强大的智能体 → 真正实现生产力翻倍 真正实现生产力翻倍 → 3 万亿美元市场成为现实 由此创造的价值将是天文数字。现在的问题是:是否有任何实验室愿意选择艰难的"修复地基"之路,而不是轻松地在停止加固的地基上继续搭建应用? 答案将决定这场 3 万亿美元的生产力革命究竟是现实,还是幻想。 注释: [1] GPT-5 中有两种方式进行乘法运算: Python 模式:使用 Python 沙箱执行 无工具模式:依赖模型内部推理 在 FrontierMath 基准测试中,Python 模式的准确率约为无工具模式的 2 倍(26.3% 对 13.5%),同时成本效益高出 4 到 10 倍。 GPT-5 API 默认使用无工具模式(必须在 API 调用中显式启用工具),而 ChatGPT 用户端很可能默认启用 Python 模式,因为"高级数据分析"(Advanced Data Analysis)已对所有订阅用户默认开启。这使得 OpenAI 在消费级产品中实现了大幅成本优化,而 API 用户若不手动启用工具使用,则需承担低效推理的全部成本。 END 本期互动内容 🍻 ❓文章指出,整个 AI 生态的繁荣建立在"代码生成能力持续进步"的假设上。你怎么看待这个观点? 文中链接 [1]https://a16z.com/the-trillion-dollar-ai-software-development-stack/ 本文经原作者授权,由 Baihai IDP 编译。如需转载译文,请联系获取授权。 原文链接: https://manidoraisamy.com/reasoning-not-ai.html

资源下载

更多资源
Mario

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长,特征是大鼻子、头戴帽子、身穿背带裤,还留着胡子。与他的双胞胎兄弟路易基一起,长年担任任天堂的招牌角色。

腾讯云软件源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题,腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构,目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称,一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集,帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Spring

Spring

Spring框架(Spring Framework)是由Rod Johnson于2002年提出的开源Java企业级应用框架,旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念,提供核心容器、应用上下文、数据访问集成等模块,支持整合Hibernate、Struts等第三方框架,其适用范围不仅限于服务器端开发,绝大多数Java应用均可从中受益。

用户登录
用户注册