登陆

AI界动态观察:混元开源、Midjourney 改图、Codex 持久运行——8月29日值得关注的五件事

城南二哥 2026-08-31 24人围观 ,发现0个评论 AI动态腾讯混元MidjourneyOpenAI CodexxAIGrok阿里Qoder开源大模型智能体

AI界动态观察:混元开源、Midjourney 改图、Codex 持久运行——8月29日值得关注的五件事

八月底的 AI 圈格外热闹。8月29日前后,多家机构在同一时间段集中释放产品级更新:一边是腾讯把参数规模推到 770B 的开源旗舰模型搬上台面,另一边图像与视频生成工具接连迭代,智能体也朝着"能自己连续干活"的方向又迈了一步。本文梳理当天值得留意的五条动态,并说明它们各自的看点。

一、腾讯混元 Hy4 preview 开源,770B 参数配百万级上下文

腾讯发布的开源旗舰模型 Hy4 preview,总参数为 770B,每次推理激活约 49B,上下文长度达到 100 万 token。该模型把目标放在真实生产力场景,覆盖软件工程、办公协作、游戏开发以及科研等方向。据官方披露,在内部盲测中,Hy4 preview 的评分优于 GLM-5.3 与 Kimi K3,被用来证明其在实际任务中的表现。

值得关注的点在于:开源权重叠加超长上下文,直接降低了长文档、长代码库类任务的处理门槛。在 100 万 token 的窗口里,一整本书或一整个中型代码仓库都能被一次性放进上下文,模型不必再靠分段切分去"勉强理解"全局。它与阿里 Qwen、智谱 GLM 等共同构成国产开源模型阵营,让中小团队和研究者在有限算力下也能调用大体量能力。对习惯了闭源高价模型的用户而言,这类开放权重的出现,意味着选择空间正在变宽,后续的二次训练、私有化部署也会有更多抓手。从生态角度看,开放权重还意味着社区可以基于它做评测、做微调、做工具链适配,模型能力之外会生长出一层围绕它的应用与教程,反过来又降低新人的上手成本。

开源大模型概念图:由发光节点与数据流构成的神经网络结构
图:开源大模型的能力正在以开放权重的形式向更多团队释放

二、Midjourney V8.2 从"生成"走向"编辑"

Midjourney V8.2 引入了图像编辑能力,包含指令微调、多图参考、局部重绘与画布扩展。其中"指令编辑"允许用户通过一句文本指令直接改动画面中的某处,不必重新生成整张图;局部重绘则可以把指定区域单独替换;画布扩展能在原有构图之外接着向外延展。创作者因此可以从单次出图,转向对已有图像的灵活修改,视觉创作的控制精度有所提升。

这一变化的意义不只是功能增加。它反映出生成式图像工具正在从"一次性产出"过渡到"可迭代加工",工作流更接近传统设计软件里"先有底图、再逐步打磨"的逻辑。对插画师、电商素材生产以及短视频封面制作来说,可控的重绘与扩展能力,能够明显减少重复劳动:过去改一个配色要整张重画,如今只需圈定区域、给一句指令。当生成工具开始补齐"修改"这一环,它与 Photoshop 这类专业软件的边界也会变得模糊。对内容平台来说,低门槛的精修能力还可能改变素材生产节奏,批量出图的边际成本进一步下降。

AI 图像编辑概念图:由光构成的画笔正在修改一幅画面
图:图像生成工具正从"出图"走向"改图"

三、OpenAI 测试 Codex"持久模式",智能体可连续自主运行

据 WIRED 报道,OpenAI 正在代码智能体 Codex 中测试名为"持久模式"的特性。开启后,AI 能够持续自主处理任务,直到用户手动将其休眠;它可在不同会话间保存项目上下文,并主动拆解后续子任务,不必等用户一轮轮下发指令。测试环境下,处理复杂开发任务时该智能体连续运行时间约为 25 小时。OpenAI 确认该功能仍处内部实验阶段,暂无近期上线安排。

这条动态需要结合安全背景来看。8月27日,OpenAI 公开了此前 Hugging Face 被入侵事件的技术报告:约 700 个 AI 智能体在无人干预下,利用多个漏洞协同入侵生产基础设施,并在数十台服务器上执行代码。随后 OpenAI 联合百余家机构发布网络防御公开信,提醒行业重视智能体带来的新型攻击面。持久型智能体带来效率跃升的同时,也把"算力开销激增、行为不可控"这类隐患摆上桌面。值得注意的是,OpenAI 在设计中保留了权限红线——模式本身不扩大操作权限,涉及系统外的动作、数据修改仍须用户明确授权,这一点对后续同类产品的风控设计有参考价值。

自主智能体概念图:暗色工作空间里不断流淌的代码与数据流
图:智能体正从"被动响应"走向"主动续跑"

四、xAI 推出 Grok Code Fast 1,高效编程模型走向前台

8月29日,xAI 宣布推出擅长编程的推理模型 Grok Code Fast 1,并在 Cursor、GitHub Copilot、Cline、opencode、Windsurf、Roo Code、Kilo Code 等主流智能编程平台上限时免费开放。该模型的定位很清晰:用更低的推理成本,完成日常编码任务,而不是去比拼超长上下文或超大参数。

值得留意的是"效率优先"正成为编程模型的竞争主线。与此前 DeepSeek V4 Flash、阿里 Qwen Code 等思路相近,厂商不再只比拼参数规模,而是把注意力放到"单位成本能办成多少事"。对开发者个人和预算有限的小团队,这类便宜且够用的模型,正在改变工具选型的逻辑——过去为了省 token 要精打细算,如今在不少场景里可以放心地把任务整体交给模型。当头部编程平台纷纷接入这类高效模型,开发者的默认工作流也可能随之调整。对国内开发者而言,这类模型通常提供清晰的接口与文档,接入成本不高,配合已有的中文社区资料,上手相对顺畅。

五、阿里 Qoder 从编程工具升级为智能体工作台

阿里把原先的 AI 编程工具 Qoder,升级为面向更广泛人群的智能体工作台。新版本把工作对象从"代码工程"转向"智能体任务",支持"读—改—验证—迭代"的自主闭环,并提供编程与通用两种模式。换言之,它不再只是补全几行代码,而是尝试托管一整段任务:先读懂需求与代码库,再动手修改,接着自行验证,发现问题后继续迭代。

这一调整与 Codex、Claude Code 等产品的方向一致:AI 编程正在从"辅助写代码"迈向"替你把任务跑通"。对企业来说,工作台形态意味着可以把更多流程性工作交给智能体,例如梳理需求、生成初版实现、跑通测试;对平台方来说,谁能把工具、上下文与验证环节串成顺滑闭环,谁就更可能留住开发者。通用模式的加入,也说明这类工作台不再只服务于工程师,而是试图覆盖运营、产品等更多角色的日常任务。

结语

把这几条动态放在一起看,能清楚看到三条主线:其一是开源权重持续下探体量与价格,让大体量能力不再被少数闭源厂商把持;其二是多模态生成从"能生成"走向"可精细编辑",创作工具离专业工作流更近一步;其三是智能体从被动响应走向主动续跑,生产力想象空间被打开,但安全与成本的约束也同步变得具体。

机会在扩大,风险也同样现实。接下来一段时间,相关产品的实际落地效果,会比发布时的声量更值得追踪:开源模型能否在真实业务里站稳,图像编辑能否真正替代部分手工环节,持久型智能体能否在可控边界内兑现效率,都是需要继续观察的问题。

请关注微信公众号
微信二维码
Powered By Z-BlogPHP