V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  slowgen  ›  全部回复第 1 页 / 共 30 页
回复总数  581
1  2  3  4  5  6  7  8  9  10 ... 30  
❮ ❯
4 天前
回复了 guin 创建的主题 › 程序员 › ai 时代怎么感觉招 js/ts 全栈还是那么少?
@mewking 没什么特别的感觉,就是速度快还有和 27B 一样多黑话。下一代 27B 的架构没有确切的消息,除非盯着蹲 vLLM 和 SGLang 的分支。
5 天前
回复了 guin 创建的主题 › 程序员 › ai 时代怎么感觉招 js/ts 全栈还是那么少?
@nicegoing 我也是直接在 Google 的 AI Studio 里让 Gemini 3.8 Flash 直接输出翻译后的演讲稿,好用
5 天前
回复了 guin 创建的主题 › 程序员 › ai 时代怎么感觉招 js/ts 全栈还是那么少?
海外 TypeScript 做全栈是因为可以部署到 CloudFlare Workers 体系,心智负担极低而且账单增长也平缓,没有运维压力,国内没有可以直接对标的产品。

而且在国内用 AI 又离不开人情世故,二线城市本来很多公司的员工本来就是专属某个语言的码农(注意和工程师的区别),出事故要拉来背锅的,如果不换语言,那么 Bug 还可以先甩锅给码农,码农还可以甩锅说已经用了最强的模型了。

虽然我以前写 Node ,又切到 Deno ,但是 AI 时代后端业务要常驻的我首选 Golang ,在 Token 经济学角度来说最划算,本地模型写得又快又准,压根不会有 Token 焦虑,像 mitmproxy 这个老牌抓包软件我前天用本地部署的 Qwen3.8 Flash Next NVFP4 安排任务移植到 Golang ,花了 8 亿多 token 就搞定了,各项性能指标都是 10~20 倍的提升,内存占用也非常低。

Rust 用来负责超高频的热点服务就好,https://www.youtube.com/watch?v=vDjW_dRyKXY 像 DHH 这个演讲也提到,将 HEY 的核心后端逻辑改由 Agent 生成 Rust 编写后,CPU 消耗降低 99%,内存降低 95%,服务器从 110 台缩减为 10 台(仅为容灾冗余保留),其峰值负载理论上一台树莓派即可承载。换到 Golang 就算悲观估计那就是 3 台树莓派也能承载,差别不大的,但是编译时间、单元测试时间、开发阶段的硬盘占用、Token 消耗都极大减少,在“生成代码→→运行测试→→捕获报错→→重新生成” 的自我纠错循环里算账划算很多。

除了应用本身服务器的成本,还要考虑到周边基础设施的成本,像数据库、缓存、消息队列、对象存储这些大部分设施都是直接买云厂商的高可用版会很贵,敢自建运维的公司少。最近 celld 这种做 CloudFlare Workers 本地部署版的设计就很激进,基础设施就依赖一个 S3 ,应用代码丢 V8 运行,如果单个实体同时访问在 50 人以下就可以设计成一个 cell ,数据库给你绑定 SQLite ,没人访问就休眠把 SQLite 丢到 S3 ,有人访问就从 S3 拉下来,没人访问时常驻内存都为 0 了,用来容灾冗余的资源也可以大幅度削减,经济帐也是非常划算,就看有没有魄力敢这么选型,我已经开始用了。
https://docs.sglang.io/cookbook/diffusion/MiniMax/MiniMax-H3 根据 SGLang 部署文档买显卡就行了
9 月 10 日
回复了 hessian 创建的主题 › 程序员 › 你们觉得现在用哪个技术栈还重要吗?
当然重要,选本地模型就能搞定的同时性能最好的那个,不受模型价格波动影响,同时做出来的应用性能也不会差到哪里去。
工具调用也要足够快,不然让模型干等也是浪费时间的。
9 月 1 日
回复了 Need4more 创建的主题 › Local LLM › mac 本地部署 llm 不是最佳选择
你假设的数据让你得到了错误的结论,因为你假设的 token 处理量太低了,当然如果你每天就用那么多,那确实回本周期慢。

我用 4 卡 RTX Pro 6000 跑 Qwen3.8 Flash Next NVFP4 ,现在一天最多是跑 54 亿 token(有峰谷,不均匀),还是因为 SM120 在新模型 Day 0 支持不给力,降级到了 marlin 的 backend 数据,要是用新内核估计处理能力还能提升 20%。

结合 Deepseek Harness 一个/goal 开放式任务可以跑 20 小时以上,最近我做了 xterm.js 移植到 dart 和 CSharp 的测试,然后用 Flutter 和 Avalonia 复刻 tabby ,并且自我迭代优化,几乎是每小时跑 1 亿 token 输入,25 到 30 万的 token 输出,缓存命中率一般在 98%~99%。按照 Qwen 官方定价每小时大概消耗 12~13 元。

现在我的 M2 Ultra 跑 Qwen3.8 Flash Next 的 4bit 量化,短的上下文时,prefill: 538.1 token/s, decode: 55.2 token/s ,长任务会衰减,假设这个数据在 M5 Ultra 上不衰减(因为增强了 AI 部分计算性能),根据 M5 Ultra 对比 M2 Ultra 的带宽差异计算,decode 的 token/s 大概在 80 ~ 100 ,prefill 速度估计可以 x10 ,这个意义在与有 KV Cache 的部分不用重复 prefill ,跑 Agent 新追加的上下文一般是并发读文件,追加的文件到上下文里几乎秒处理完,保守点的估计每小时 3000 万到 5000 万的 token 应该有,对比官方定价每小时消耗 6 元,一个月是 4320 元,M5 Ultra 256G 的 24 期免息分期费用每个月是 3615 元。
今晚 Qwen3.8-Flash-Next 发布,和 Ling-3.0-Flash 差不多大小,125B A6B ,如果性能追上 DeepSeek v4 Flash 0731 的话,其实 256GB 就够。

人的欲望总是随着新模型的发布不断上涨,买 512GB 赌的是未来这个容量可以跑下更大更 SOTA 的开源模型,赌 Fable 5 级别的模型很快就可以跑在个人设备上。
unsloth 的 NVFP4 没什么问题,反而是 SGLang 用 RadixArk 的那个 NVFP4 + DSpark 有大问题,给了 85G 显存还会 OOM 。
LMCache 记得用,冷对话的 KV Cache 可以转移到内存,避免时间太久对话被丢掉需要重建 KV Cache ,从而又走一遍 prefill 阶段。

同时今天出 Dflash 2 ,加速效果比 DSpark 还猛,可以继续测了。

我这几天用 DeepSeek Harness 跑 DeepSeek-V4-Flash-0731 和 Qwen3.8 27B ,都是 NVFP4 ,跑了几亿 token 做测试,结果在做 GUI 方面 Qwen3.8 很亮眼,在移植 tabby 项目到 tauri2 + rust 的测试中,有以下难点:
1.我在虚拟机里跑的 Linux Mint ,GPU 是虚拟的,可能用不到加速,运行过程中可能黑屏白屏、帧数低等问题;
2.rust 编程能力的问题
3.e2e 测试的问题,自动化界面点击测试

Qwen3.8 27B 全面领先,毕竟有视觉能力,一路高歌猛进,/goal 设定目标就可以了,虚拟机丢旁边看着它一直推进,SFTP 面板都在做 GUI 的冒烟测试。构建完成后空载内存只有 39MB ,看到原子弹爆炸了。
就是中间有一个 bug ,反馈给它后,它自己用了插桩、探针、前端 SPY 、hook 多种手段来调试,花了 5100w 的 token ,修了一行代码,再次看到原子弹爆炸,xhigh 真就是用电力换能力了。
8 月 15 日
回复了 majuzhang 创建的主题 › Local LLM › 公司本地部署开源模型
如果 MiniMax M2.7 级别的模型能满足你,那么今天 Qwen3.8-27B 的能力就超越了 M2.7 ,还是多模态,你只需要 5090 就可以了,使用 SGLang 的方案在单个 5090 上,结合 NVFP4 和 DSpark ,解码速度达 206.1 tok/s https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B ,随着人数的增加来加卡就行。

如果你想要更好的模型能力,那么用 DeepSeek V4 Flash 0731 的 NVFP4 量化也行,RTX Pro 6000 现在涨价厉害可以退一步买 RTX Pro 6000D 这个被砍一刀的卡,2 张有点吃紧但是能跑,4 张就最好,我这里 4 张卡一天跑 20 亿 token 没问题,最大的问题就是这个成本对比买 API 哪一个划算,哪一个符合你们要求。

用多台 DGX-Spark 串联跑,也 ok ,https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

最好使用 LMCache 来把 KV Cache 转移到内存,这样显存放模型,内存放 KV Cache ,速度也不会慢多少,显存容量的要求也降低,可以让更多的大上下文进来,工程上都是这么玩的。
结合好的 Agent 比如最近的 DeepSeek Harness ,缓存利用率大部分都是 95%~99%,对 prefill 速度友好。
7 月 30 日
回复了 davinci21s 创建的主题 › 分享发现 › 想做 AI 漫剧/沙雕动画,第一步就卡住了
@davinci21s 迁移动作才占你视频的百分之多少?不都是先做分镜图然后图生视频吗?你可以租个 5090 到 RTX Pro 6000 这个级别的显卡,配合 NVFP4 跑,刷新一下认知。反正我们做 5s 的 720p 视频一个就几十秒
7 月 30 日
回复了 davinci21s 创建的主题 › 分享发现 › 想做 AI 漫剧/沙雕动画,第一步就卡住了
谁告诉你本地模型几秒钟的视频要半小时?你的数据来源都是错的
鸡腿肉丁一样低脂又便宜,口感比鸡胸肉好多了。
光是油这一样就占了很多因素了,饭店的油有点水平都自己调配过,加了增香的料进去炸过
7 月 2 日
回复了 maliaosaide1 创建的主题 › 问与答 › 请警惕账号 w1573007 发布的开源项目 Termo
198 一个号,这个价格比很多网游账号的价值都高啊
本地跑大模型还得是 Blackwell 架构的 RTX Pro 6000 ,直接上 NVFP4 量化,真的就一代架构一代神
从 CTO 角度来说难度可能不大,比如用绞杀者模式逐步替换 API ,结合流量镜像方案把生产流量同时导入测试环境的新老系统看数据对比来验证防止翻车等,手段很多。

如果是从培养你角度让你直接参考 https://typescript-is-like-csharp.chrlschn.dev/pages/intro-and-motivation.html 这种方便 TypeScript 熟练工快速学习 C# 的文档两天就能上手读懂项目,渐进式重构问题也不大。

但是选择的方案这么激进,对你来说难度就很大了,起码出一个风险应对方案来,除非业务规模很小,项目也不大。

同样是选择 AI 方案,还不如先让 AI 把当前系统优化好。
6 月 11 日
回复了 addou 创建的主题 › 生活 › 家里有蛇,怎么办
最好确认是什么蛇,我之前在农村路骑车的时候碰到一条好大的蛇,作死上去拍了点视频,发群里了才知道是剧毒的银环蛇
6 月 6 日
回复了 suckinbottle 创建的主题 › 职场话题 › 纯吐槽公司技术团队现状
你们少了一个技术能力过硬的架构师,而且你们后端太菜了,不然的话让后端从 PHP 转 Node 没毛病很顺利的。

我以前带团队就是从 PHP 转 Node 的,把语言特性、相似函数、相似库、各 Web 框架相似性等细节全部拉出来对比讲透,不用 3 天大家就可以开干了,然后过程中跟进代码和 review 就完事了。有 AI 之后更方便,现在技术栈我都换了几轮了。

用渐进式重构方案,一部分接口替换完之后流量重定向到新代码,要是有问题就把流量切回去,都是一套工程化体系的东西,要是基建水平不行那还得把基建搞好。

说白了你们后端的连 AI 都比不过,原地踏步,一潭死水,不过也不奇怪,毕竟现在还在坚守用 PHP 的公司绝大部分也就这样了,就连百度早在多年前就禁止新项目使用 PHP 了。
5 月 31 日
回复了 rivercherdeeeeee 创建的主题 › 生活 › 家用落地扇推荐
别买小米,24 小时开机的坏了 2 个了,都是过保就坏
1  2  3  4  5  6  7  8  9  10 ... 30  
❮ ❯
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   949 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 49ms · UTC 21:41 · PVG 05:41 · LAX 14:41 · JFK 17:41
♥ Do have faith in what you're doing.