首页 文章 精选 留言 我的

精选列表

搜索[视频编解码器],共10001篇文章
优秀的个人博客,低调大师

FLAC 1.4 发布,无损音频编解码器

FLAC 是 Free Lossless Audio Codec 的缩写,它可以减少存储数字音频信号所需的存储空间,而不需要在此过程中删除信息。 由该软件读取和产生的文件被称为 FLAC 文件。由于这些文件(遵循 FLAC 格式)也可以被其他软件读取和写入,这个软件通常被称为 FLAC 的参考实现。 近日 FLAC 1.4.0 正是发布,这也是自 FLAC 1.3(2013年5月)发布以来,近十年时间后的又一次更新。 此次更新中,值得用户关注的改进包括: FLAC 现在可以编码和解码 32 位采样的音频 预设 3 到 8 的压缩率有所提高,编码速度只有小幅下降,而预设 0、1 和 2 的速度变快了 在 64 位 ARMv8 上的压缩现在要快得多(例如在新的 Mac 电脑中使用) 在 x86_64 方面,FLAC 1.4 为支持 FMA 指令的英特尔/AMD 处理器带来了速度的提升 可以将 libFLAC 和 flac 工具生成的 FLAC 文件的最小比特率限制为 1 bit/sample 可以对采样率高达 1'048'575Hz 的文件进行编码了 libFLAC 的版本号增加到了 12,libFLAC++ 的版本号增加到了 10 libFLAC 和 libFLAC++ 的 API 和 ABI 都有变化 XMMS 插件和 "common" 插件代码 (仅由 XMMS 插件使用) 已被废弃,它们将在未来的版本中被移除 编码预设的改进 FLAC 格式文档的重写 CMake 构建系统的改进 更多详情可查看:https://github.com/xiph/flac/releases/tag/1.4.0

优秀的个人博客,低调大师

新技术:无需编解码器,NEO-unify如何打造原生视觉语言理解与生成

当前多模态智能架构困境 长期以来,多模态研究已形成一种默认范式:视觉编码器(Vision Encoder, VE) 负责感知与理解,而变分自编码器(Variational Autoencoder, VAE) 则用于内容生成。近期的一些工作尝试构建共享编码器,但这种折衷往往引入新的结构性设计权衡。 由此回到第一性原理:构建一体化模型直接处理原生输入,即像素本身与文字本身。商汤科技联合南洋理工大学,提出一种全新的架构范式:NEO-unify(preview),一个原生、统一、端到端的多模态模型架构。它不仅越过了当前视觉表征的争论,也摆脱了预训练先验和规模定律瓶颈的限制。最关键的是:不需要 VE,也不需要 VAE。 我们正扩大规模、持续迭代。更多模型与开源成果,将很快与大家见面。 NEO-unify原生一体化架构新范式 NEO-unify 第一次迈向真正的端到端统一框架,能够直接从近乎无损的信息输入中学习,并由模型自身塑造内部表征空间。首先,引入近似无损的视觉接口,用于统一图像的输入与输出表示;其次,采用原生混合Transformer(Mixture-of-Transformer,MoT)架构,使理解与生成能够在同一体系中协同进行;最终,通过统一学习框架实现跨模态训练:文本采用自回归交叉熵目标,视觉通过像素流匹配进行优化。 模型效果 1. 定量结果分析 2. 生图效果展示 技术发现 1. 无编码器设计能够同时保留抽象语义与细粒度表征 [图像重建任务] 我们先前的工作NEO(Diao et al., ICLR 2026)表明,原生端到端模型同样能够学习到丰富的语义表征。在此基础上,我们进一步观察到一个有趣的现象:即使在冻结理解分支的情况下,独立的生成分支仍然能够从表示中抽取并恢复细粒度的视觉细节。 基于这一发现,我们训练了NEO-unify(2B)。在初步 9 万步预训练后,模型在 MS COCO 2017 上取得31.56 PSNR和0.85 SSIM,而Flux VAE的对应指标为32.65和0.91。这一结果表明,即使不依赖预训练VE或VAE,近似无损的原生输入仍能够同时支持高质量的语义理解与像素级细节保真。 域外图像重建(2B NEO-unify,理解分支冻结) [图像编辑任务] 据此,我们进一步开展探索:NEO-unify将所有全模态条件信息统一输入到理解分支,而生成分支仅负责生成新的图像。 即使在冻结理解分支的情况下,NEO-unify(2B)仍展现出强大的图像编辑能力,同时显著减少了输入图像令牌的数量。在使用开源生成与图像编辑数据集并进行初步 6 万步混合训练后,模型在ImgEdit基准上取得3.32的成绩,且理解分支在整个训练过程中保持冻结。 小规模数据验证(2B NEO-unify,理解分支冻结) ImgEdit提示词编辑(2B NEO-unify,理解分支冻结) 2. 无编码器架构与 MoT 主干高度协同大幅降低内在冲突 借助预训练的理解分支与生成分支,NEO-unify使用相同的中期训练(MT)与 监督微调(SFT) 数据进行联合训练。即使在较低的数据比例和损失权重下,理解能力依然保持稳定,而生成能力则收敛很快。二者在 MoT 主干中协同提升,整体冲突极小。 3. 无编码器架构,展现更高数据训练效率 此外,我们首先进行 web-scale 预训练,随后在多样且高质量的数据语料上依次进行中期训练(MT) 和 监督微调(SFT)。与 Bagel 模型相比,NEO-unify 展现出更高的数据训练效率,在使用更少训练 token 的情况下取得了更优的性能。 未来展望 这不仅仅是一种模型架构探索,更是迈向下一代智能形态的一步: • 感知与生成交织的闭环 • 全模态推理 • 视觉推理 • 空间智能 • 世界模型 • … 一条新的路线图正在展开:模型不再在模态之间进行转换,而是能够原生地跨模态思考。多模态 AI 不再只是连接不同系统,而是构建一个从未割裂的统一智能体,并让所需能力从其内部自然涌现。 《NEO-unify:原生架构打造端到端多模态理解与生成统一模型》 英文博客地址: https://huggingface.co/blog/sensenova/neo-unify 中文博客地址: https://www.sensetime.com/cn/news-detail/51170543?categoryId=72

资源下载

更多资源
腾讯云软件源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题,腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构,目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称,一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集,帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Sublime Text

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能,例如代码缩略图,Python的插件,代码段等。还可自定义键绑定,菜单和工具栏。Sublime Text 的主要功能包括:拼写检查,书签,完整的 Python API , Goto 功能,即时项目切换,多选择,多窗口等等。Sublime Text 是一个跨平台的编辑器,同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源,继承了IntelliJ IDEA强大的JS部分的功能。

用户登录
用户注册