V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  sentinelK  ›  全部回复第 1 页 / 共 91 页
回复总数  1817
1  2  3  4  5  6  7  8  9  10 ... 91  
❮ ❯
AI 好用的前提,就是你得给他充足的上下文。也就是既有信息。
你问他张三为什么不爱我,一它不知道张三是谁,二它不知道你是谁,三它不知道你们之间发生了什么。
他怎么给你出谋划策
22 小时 25 分钟前
回复了 Srande 创建的主题 › 程序员 › 32 岁做啥啥失败,是不是该被斩杀了?
楼主说的这个我个人很有感触。我觉得这个事儿他有几层的理解。共勉。

1 、一件事做的好,不一定能赚钱。
2 、能赚钱的,不一定是好事、也不一定是因为做的好而赚钱。
3 、赚钱的路和做好一件事的路,其实本质是两条路,或多或少在方向上有个“夹角”。有的事儿夹角非常大,甚至是 180°。
4 、一个商业逻辑的表面,和其实际的核心,其实也是完全牛马不相及的两件事。

我的理解,本着匠人精神的心态去赚钱,成功率无限接近 0%。
想要深入某个领域赚钱,要先去了解赚钱的逻辑,然后再去寻找其中的机会和发挥的空间。而不是先发挥,再寻找商业逻辑。

个人拙见。
@jinsongzhaocn 按照官方“吹”的原话,是 IQ3_S 和全量几乎一致。IQ3_XXS 大概是 98.x%的一致性。

我的理解一致性比例相同理论上讲能力趋势也应该相同。
https://artificialanalysis.ai/ 上 qwen3.8-flash 是 40 分,27B 稠密是 34 分。

那么理论上讲一致性和困惑度与 3.8-flash-IQ3_XXS 相近的 27B-nvfp4 也应该遵循这个能力差距。至少应该不会逆转。

我个人是这么肤浅的理解。
经此配置后,strata + qwen3.8-flash-next IQ3 这套组合,在驱动 harness 这个领域,除了并发效率以外,已经完美吊打 sglang+qwen3.8-27B-nvfp4 这套传统的全量显存组合。

首先,strata 因为基于 llama.cpp ,所以不存在 memba 层和 kvcache 层的抉择问题。
其次,IQ3_XXS 的 qwen3.8-flash-next ,模型能力本身超过 qwen3.8-27B-nvfp4 。
最后,无论是 prefill 的稳定度还是 decode 速度,strata 这套混合架构+MOE 模型,均超越了 27B 稠密模型的性能表现。
是的。
但是商业社会从来不是用产品的“技术含量”、“革新程度”来定价的。

微信和米聊相比,有什么创新吗?甚至主色调都一致,但这不妨碍微信干死米聊。
9 月 29 日
回复了 yiranw09 创建的主题 › 程序员 › 继 opencode go 之后, commandcode goat 也搞欺诈
@nightwitch 合作是有的,在 ds 涨价成峰谷之前,opencode go 就是 100%的官方中转。

涨成峰谷之后,opencode 就有自部署的尝试了。之前还是灰度的。
这次是完全自部署。
9 月 28 日
回复了 yiranw09 创建的主题 › 程序员 › 继 opencode go 之后, commandcode goat 也搞欺诈
opencode 也是,名义上 60$永久,但本质上从官方中转换成了自部署。

tg 只有不到 100t/s ,缓存命中率 95%。更恶心的是上了一些莫名其妙的限制。比如同 session 只能最大 30 张图片。
9 月 24 日
回复了 ghmum 创建的主题 › OpenAI › 想用 ds4.1,应该用哪个 harness?
1 、deepseek 的 API 天然支持 responses (三种 API 格式都支持),所以接入 codex 不需要中转。中转会出现莫名停止的问题。

2 、claude code 这种闭源的最好别用,总是更一些 API 的 feature ,导致缓存命中概率降低。

3 、从情理上讲,人们总是认为自家模型适配自家 harness 工具应该是最好的,但实际未必。
9 月 23 日
回复了 viskem 创建的主题 › OpenAI › 相比旗舰模型,低端模型更会说人话?
以后很有可能文学 LLM 和业务 LLM 会彻底分家,比如更多类似 https://huggingface.co/Altworld/Hemmingway-1 会冒出来。
9 月 23 日
回复了 viskem 创建的主题 › OpenAI › 相比旗舰模型,低端模型更会说人话?
@viskem 是的,我理解就是人话里面有太多“模糊”和“婉转”了。现实任务其实是定量的,或者说人类的活动为了精准故意设定成了定量为主。所以“讲人话”对于 LLM 的 Agent 场景来讲,其实是一种噪声信息,反而降低了统计学最优解的信噪比。
9 月 23 日
回复了 viskem 创建的主题 › OpenAI › 相比旗舰模型,低端模型更会说人话?
跟后训练对齐的方式有关。“人话”从目前的跑分(强化学习目标)的角度来讲,是一种很低效的指标。

换句话说,人话在 Agent 、Coding 这种场景是非常反效率的。
看楼上的回复,感觉好多人对于跨平台有很大误解。认为跨平台和原生的代码量是 1:2 ,我个人理解,无论是什么跨平台生态,和原生的代码量基本是 1:1.5 ,甚至是 1:1.3 。
自动停止是 cc-switch 代理转换的问题。

在目前,你可以理解为 codex 只能跑支持 responses API 的模型 provider
9 月 21 日
回复了 FaustinaD 创建的主题 › AirPods › Airpods5 到手,说下感受
@sevenyangcc 楼主 @FaustinaD 当年的健身帖也是 v 站神帖,印象深刻。

我也是受到楼主的鼓舞才开始减肥的。
9 月 20 日
回复了 tommyZZM 创建的主题 › 程序员 › 提示词工程师会最终出现吗?
提示词工程师我理解,就跟当年的“电梯工”一样。
属于基于现实硬件性能环境,以及特殊使用场景,诞生的一种纯临时性应急岗位。

现在医院这种超高人流量、突发事件比较多的场景依然有“电梯工”。
9 月 18 日
回复了 tobacco 创建的主题 › Android › 豆包手机发布了,好像没啥讨论的
工具的核心就是得省精力。

目前所有的 Agent 其实本质上都是一件事上的注意力和精度之间的取舍。
你越选择少分担注意力(越多的交给 Agent 定夺),结果精度就越差。

然而现实生活中其实很少有那种需要占用巨大注意力,且可以接受低精度结果的场景。(毕竟你不可能把你所有的数据都交出来)

另外就是要求第三方自愿同意交出 app 的注意力权力给模型,其实是反人性反利益的。
9 月 17 日
回复了 s 创建的主题 › 程序员 › v2ex 帖子排序机制是什么?过去的帖子顶不上来?
不光是坟帖的问题,v 站有个权重算法,自己回帖、相同账号重复回帖基本不占权重。

看的人越多、越多不同的人回帖,越靠前。
@yh7gdiaYW 可能是跟 claude code 接入 GPT 模型需要代理有关,代理还是有信息损失和额外干扰。

不过这个结果确实有点娱乐效果。太逗了。
@longaiwp 千问系列就明确官方跑分都是 claude code 环境,反正模型结构注定放弃响应速度了,不如提高跑分上限。
@Jerry02 是,所以我认为“租金”这个成本定义不贴切。
1  2  3  4  5  6  7  8  9  10 ... 91  
❮ ❯
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3461 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 28ms · UTC 04:59 · PVG 12:59 · LAX 21:59 · JFK 00:59
♥ Do have faith in what you're doing.