V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  maolon  ›  全部回复第 3 页 / 共 20 页
回复总数  386
1  2  3  4  5  6  7  8  9  10 ... 20  
可以参考 deepswe 的测试,基本任何情况下都有一个 sol 或者 luna 的节点优于 terra: https://i.imgur.com/nayd5TH.png https://i.imgur.com/nddUacX.png https://i.imgur.com/9C5GWKm.png
这玩意儿最大的问题是开了以后用你默认的模型在后台偷偷烧 quota ,如果你项目多那恭喜你,我之前一个 plus 账号啥都没做就把 5 小时的 quota 烧完了两次
7 月 7 日
回复了 linlincie 创建的主题 iPhone iOS 27 beta3
多了个索引,然后 apple intelligence 多个 3g ,不知加了什么模块需要这个索引
7 月 2 日
回复了 goumadantui 创建的主题 问与答 豆包为什么是神?
我说定型文就是好用
就很...你懂的吧
用的 zai 的 coding plan ( pro ),opus4.6-4.7 水平左右吧,其实很难评价
因为国产模型一直是跑分高(跑分一般覆盖主流语言和应用场景)但是 corner case (比如冷门一点的语言)一直不如 a/和 oai , 数据分析能力也是差那么点水平,根据用途不同上下限差很远
6 月 29 日
回复了 92pretty 创建的主题 互联网 如何看待腾讯在 AI 大模型方面的全部落队?
你看小米就知道这个追起来难度不高了,腾讯等着你们钱砸的差不多了,市场差不多明确了再砸钱下场追也不迟,

顺带一提腾讯也不是没有自己 LLM 模型只是比较路边而已,也就是团队在,资源在,养着团队等就行了
6 月 29 日
回复了 hiboshi 创建的主题 程序员 现在没什么好用的 coding plan 了吗?
只有 cursor+composer2.5 组合, $20 的基础套餐就基本用不完了,$60 更是夸张到每月用个 2500M ,缺点是规划和前端差一些,规划用其他模型(比如 glm5.2 )补上就行了。当然 cursor 只要用其他家的模型他的 quota 就会瞬间消失,

可能 cursor 做 coding worker ,opencode go 的$10 的 glm 做 planning 就是非常好的组合了

本来 codex 是个很好的选择,可惜 5.5 降智到狗都不用(一半以上的请求的 thinking effort 被限制在 512 tokens ),除非 5.6 出了不然不需要考虑
这么多概念就是因现有的没法完整描述,以及有他的历史阶段性
prompt 试图解释的是如何有效的使用提示词驱动大模型,对应的是 2022-2023 最早期阶段 context 只有几 k,对话只能对个几段就必须截断的阶段,这个阶段能完整的跑个一两个 round 就不错了,所以才强调怎么在一个 round 里高效的输出结果。
context 对应的是第二阶段的 2024-2025,这个阶段里模型的上下文空间快速增长,让多轮的长任务成为可能,然后一个现象就被观察到了,就是 context rot, 上下文腐化,一个上下文里堆了太多的东西会影响 agent 表现,所以提出了 context engineering 用于解释如何合理的管理你的上下文。
harness 对应的第三阶段 2025 年末到 2026 年初,此时 agent 已经可以执行非常长的任务了,问题变成了任务漂移,此时 harness 解决的如何使用外部约束硬性约束 agent ,减少他的上下文漂移。
loop 这个我觉得才是有点没活硬整的部分,因为我认为 loop 本身就应该归入 harness 的一部分,虽然现在 agent 本质上就是一个 loop ,以及如果你学过控制原理就会发现不管是 harness 还是 loop ,最终的结构都是一个控制反馈回环。
什么文艺复兴,你大概不知道谷歌曾经有一个死了 10 年的竞争对手叫 ChaCha 吧
@catwalk #6 一般不开, 本身速度就很快了,开了是 x3 的价格,我觉得提升的速度不值这个价
@catwalk Pro+ 你只用本家的 composer2.5 就是爽用,一个月能用个 2500M 左右,速度快效果好,除了规划能力和前端差点没什么大缺点,规划换 5.2 就行了
6 月 22 日
回复了 ryougifujino 创建的主题 程序员 高估了 GPT5.5 ehigh 的能力
不光削了 thinking effort ,还肯定量化了模型,现在 5.5 蠢的没法用,
我觉得单纯写代码还不如 composer2.5, 和两个月前比根本不是一个模型。
我更好奇是 composer 2.5 强还是 2.7 code 强,
要是 2.7 code 还比不过 composer 2.5 这个 k2.5 的继续训练版本就搞笑了
所以 claude 才不允许除了 claude desktop 和 claude code 以外的产品使用他的订阅,哪怕你要程序化调用(比如-p ) 15 号后都不给你用自己的订阅的 quota 。
openai 他现在是追赶者,那当然有的牌都要打出来,更何况他还要打 api 价格战呢,你可以算算到时的补贴倍数。
6 月 12 日
回复了 ximaoyang 创建的主题 WWDC 苹果 WWDC2026 拉完了
我就搞不懂了,苹果为什么要急。苹果坐拥全世界数量最大的个人终端入口,你 agent 再牛逼还不得运行在一个硬件上,这个硬件至少 5 年内依然是智能手机。

苹果走端侧 + 端侧硬件优先策略,本身 apple silicon 在手机上就是领先的芯片,gemini 就算 coding 和 agent 能力不行他也是目前多模态(音,文字,图像,视频)支持的最全最优秀的模型,和苹果需要的能力完全一致。你 fable 和 5.5 再强也不支持原生音视频啊。

再说端侧模型这个市场上竞争很激烈吗,并没有好吧,现在国产都在玩 1T+模型,a 和 oai 玩 5T+的,端侧里就 qwen 和 gemma 这两个主要玩家。
用户 ID 397 谢谢老板
为什么不用 batch api 来做,就算只走各家官方的 batch api ,价格正常来说也是普通 api 的 1/10 ,基本等于全程缓存的价格
5.5 = 5.4 X 2
5.4 = 5.3 / 5.2 X 1.7
这个用量你就算吧,5.2 时代的 plus 都不能站起来蹬
1  2  3  4  5  6  7  8  9  10 ... 20  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2643 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 32ms · UTC 15:31 · PVG 23:31 · LAX 08:31 · JFK 11:31
♥ Do have faith in what you're doing.