面条实验室
1.72K subscribers
440 photos
9 videos
1 file
371 links
折腾些什么玩意。

群组 @miantiao_chat
Download Telegram
Forwarded from Agili
🔥 OpenAI & Anthropic 双王炸:GPT-5.3-Codex 与 Claude Opus 4.6 同日发布(含用户即时评价)

今天是 2026 年 2 月 5 日,AI 界的“超级星期五”。OpenAI 和 Anthropic 不约而同地亮出了底牌。根据 Reddit、Hacker News 上第一波用户的反馈,战况比预想的要复杂,甚至有点“割裂”。


🤖 OpenAI: GPT-5.3-Codex

"想接管你的电脑,而且它真的变强了"

GPT-5.3-Codex 现在的定位是全能 Agent

用户评价:👍 代码与终端操作强: 很多开发者反馈它在 Terminal Bench 上碾压了对手(77.3% vs 64%),是目前最强的 CLI 操作者。有用户直言:“它虽然慢,但写出来的东西是对的,不用我再去擦屁股。”
👍 自我修复: 它不只是写代码,还能自己跑测试、查错、修 bug。
👎 速度慢: 因为要读更多上下文、做更多检查,反应速度明显不如 Claude Code。
👎 甚至有点“啰嗦”: 有人吐槽它太爱聊天了,而 Claude 更直接。


🧠 Anthropic: Claude Opus 4.6

"代码更强了,但...灵魂呢?"

Anthropic 这次让人又爱又恨。

用户评价:👍 编码能力提升: 升级后的 Claude Code 在 SWE-bench 上得分很高(80.8%),写代码确实更利索了。
👎 写作能力“被阉割”: 这是最大的槽点。大量用户(包括 Hack News 和 Reddit)抱怨 Opus 4.6 的写作质量下降,甚至有人用“Lobotomized”(切除脑叶)来形容。它写出来的东西变得干瘪、缺乏灵气,甚至不如上一代 Opus 4.5。
⚠️ 建议: 现在的共识是——写代码用 Opus 4.6,写文章/搞创作请坚守 Opus 4.5


⚡️ Agili 的看法

现在的局面很有趣:

OpenAI 赢在**“干脏活累活”**(OS 操作、终端调试),它想做那个不嫌麻烦的超级实习生。
Anthropic 赢在**“快和灵”(Claude Code 体验依然丝滑),但在通用写作**上似乎为了强化逻辑而牺牲了文采。
给你的建议:
如果你是写代码的,哪怕慢点,GPT-5.3-Codex 值得一试;如果你是写周刊、做内容的,先别急着把 Claude Opus 4.5 换掉,现在的 4.6 可能写不出你要的那种“人味儿”。

#AI #OpenAI #Anthropic #GPT5 #ClaudeOpus #真实评测
👍32
Forwarded from 面条的草稿箱
聪明人的分工:让昂贵模型做规划,便宜模型去执行

知名开源开发者 shadcn 刚刚开源了一个全新项目——improve

这是一个非常巧妙的 Agent Skill,它的核心理念是:用你最聪明(也最昂贵)的 AI 模型来做高杠杆的脑力劳动(审计代码、写技术方案),然后把脏活累活(编写代码、跑测试)交给更便宜的 AI 模型去执行。

这个工具本身绝对不会直接修改你的一行代码,它的产出就是一份清晰、可执行的 Markdown 格式实施方案

💡 它是如何工作的?

1. 项目审计 (/improve):高阶模型会深度扫描并分析你的代码库,指出潜在的 Bug、性能瓶颈、安全隐患或技术债,并产出一份按“投入产出比”排序的发现清单。
2. 制定方案 (plans/):当你挑选出需要解决的问题后,高阶模型会针对每个问题输出一份极其详尽的方案(Plan)。这些方案是“自包含”的,带有明确的验证命令、执行边界和异常中止条件(STOP conditions)。
3. 分发执行 (/improve execute <plan>):你可以把这些高可读性的方案直接扔给任何便宜的轻量级 AI Agent。轻量级模型只需像个机械的执行者一样,按照步骤修改代码、运行测试,最后向你提交 Pull Request。

🚀 核心指令一览

/improve:全局审计并输出优化点。
/improve quick:快速扫描重点。
/improve deep:对每个包、每个分类进行详尽审计。
/improve plan <description>:跳过审计,直接为指定任务编写执行方案。
/improve execute <plan>:派发给便宜的执行器模型并审核其成果。

安装方式

项目支持 Agent Skills 规范:

npx skills add shadcn/improve


https://github.com/shadcn/improve

#AI开发 #智能代理 #软件工程 #GitHub开源 #shadcn
2
Forwarded from 面条的草稿箱
让 AI 自主付费:Cloudflare 推出面向 Agent 的可编程钱包

在 AI 时代,智能体(Agent)想要尝试新的 API 或付费内容并不容易。它们既没有稳定的身份去注册,也无法像人类一样直接绑定信用卡,这大大限制了“智能体商业”的发展。

为了解决这一痛点,Cloudflare 宣布推出 Cloudflare Wallets,为 AI 智能体提供原生的支付与身份验证方案。

核心设计与功能:

双层钱包架构
账户钱包 (Account Wallets):由人类账号所有者管理,负责资金充值与规则制定。
虚拟钱包 (Virtual Wallets):分配给 AI 智能体使用。人类可以为其设置“零花钱”限额、白名单和单次交易上限,让 AI 在可控风险内自主测试不同的 API 服务。
微支付支持:结合 Monetization Gateway,钱包利用 x402 协议实现了将支付信息直接附加在 HTTP 请求中,极大地简化了机器对机器的交易流程。
可读的智能体身份:用户可以为自己的账户申领 cloudflare.pay 域名。AI 智能体在访问服务时,可以通过如 research.example.cloudflare.pay 这样的可读标识公开身份,便于商家提供试用额度或进行白名单管理。

Cloudflare Wallets 的推出,意味着未来互联网将迎来一个专为 AI 设计的、无缝的“机器原生”交易市场。

原链接:https://blog.cloudflare.com/wallets/

#Cloudflare #AI智能体 #数字钱包 #网络支付 #微支付
1