coefu

coefu

V2EX member #616381, joined on 2023-02-28 17:15:35 +08:00
Today's activity rank 1777
Per coefu's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
coefu's recent replies
@deali pubg ?
Windows 于我而言唯一的用途就是 steam 。😂
muse 开源的那个 glimmer 30B ,在 tool use 上确实可以。这一块是加强了的。

但是除此之外,就马马虎虎了。
1 day ago
Replied to a topic by banjueaz › 职场话题 › agent 开发以后会被淘汰吗
和之前搞提示词一样的,就是个过渡性质的工作岗位,随着工程明朗清晰起来,很快就是一个稳定的流水线。

不会再需要各种定制了。
1 day ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@oldlamp amd 有这效果,也算值当了。
2 days ago
Replied to a topic by calloc › 程序员 › 当看到文章说 AI 又解决了一个难题
这取决于你认知里的“AI”是什么?

201x 年代 围棋里起势的是 深度强化学习 DRL ,和当前的 LLM 不是一个路线。

202x 年代 涌现智能的是 围绕 transformer/mamba 体系的 NLP 路线。

至于当前解决数学难题的是 围绕 LLM 的 agent 工程路线,通过分布式 agent 集群扩大智能深度。
3 days ago
Replied to a topic by victorysl › 职场话题 › 当时只道是寻常啊兄弟们
@diudiuu 你小子上岗了啊,市场竞争力可以啊。
3 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@catazshadow 我觉得这个是 dsh 的通用功能,实际上就是把本地 session 让模型自己搞一次压缩,压缩结果都是显式在 web 端可以看到的,然后占用一些当前会话的 agent prompt 。我也是昨天才更新了一下 dsh ,发现有这个压缩的过程。

我这个 context 都搞了几轮 262144 的 context ,太长了,傻不傻,我都没能力区分。反正过程最终有个最终目的 test 。
还是有点区别的,各家在 benchmark 上跑分的侧重点都不同,有些就只适合于 tool use ,有些适合 coding ,有些适合做 scicode 。

模型架构,以及 后训练阶段,其实都可以做出很多不同。
3 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@catazshadow deepseek harness ,v 0.1.5 能主动压缩 context ,我在一个会话里 用 qwen3.8 flash next 干到 83 轮 652 步 还能 9.8 tok/s ,之前的 qwen3.8 27B 早就要掉到 0.x tok/s 了。

ISTA-DASLab 的压缩量化技术,确实屌。 希望 qwen4 能更上一层楼,之前我还喷 qwen ,😂,真是要自我掌嘴了。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   874 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 12ms · UTC 19:55 · PVG 03:55 · LAX 12:55 · JFK 15:55
♥ Do have faith in what you're doing.