x1x2's recent timeline updates
x1x2

x1x2

V2EX member #681706, joined on 2024-03-24 21:12:12 +08:00
Today's activity rank 15511
x1x2's recent replies
2 days ago
Replied to a topic by x1x2 分享创造 聊聊 vibe 心得 - 1
@laser_lu 国内备案还有支付,我觉得都是比较麻烦的
2 days ago
Replied to a topic by x1x2 分享创造 聊聊 vibe 心得 - 1
@laser_lu 不上国内行不行。。。
2 days ago
Replied to a topic by x1x2 分享创造 聊聊 vibe 心得 - 1
@vodmaker 看完你这个项目,我无地自容,我 vibe 出来的简直就是辣鸡
2 days ago
Replied to a topic by x1x2 分享创造 聊聊 vibe 心得 - 1
@Clannad0708 邮箱验证我用的 Supabase 。其他比如 vercel ,我看有人说了。另外还有 cloudflare 、langfuse 、google cloud run 、godaddy 等等。。。AI 调研可以的啊,你多问问,这些服务怎么用,该怎么选,都会告诉你。
2 days ago
Replied to a topic by x1x2 分享创造 聊聊 vibe 心得 - 1
@silencil 感谢感谢~ 测试这块是我妄言了,我刚检查了代码,我这个项目其实是集成测试为主,单元和冒烟都不多。 冒烟测试我个人感觉也很影响效率啊,测试效果也一般(我 Playwright 和 computer use 都有用)。 这块有没有什么具体的建议?
楼主最后用什么形式解决的?
May 28
Replied to a topic by x1x2 分享创造 自用的音频转文字 Mac 应用
@Rain59 可以了,实时转用了 small 模型,正好可以对比看看效果。不过我个人基本没有实时转的需求
May 23
Replied to a topic by x1x2 分享创造 自用的音频转文字 Mac 应用
是,中文识别率确实一般。没有做过取舍,单纯觉得是不是 large 比 medium 识别准确率可能更高,但实际效果半斤八两。 我现在的工作流是,先转成文本,然后再让 gpt/opus 润色一道。不得不说,SOTA 就是 SOTA ,很刁钻的误识,都能识别出来。

下面是我刚刚转的文本错误和修正汇总


┌───────────────────────────┬──────────────────────────────────────────┐
│ 原文 │ 修正 │
├───────────────────────────┼──────────────────────────────────────────┤
│ 伤/商(贯穿全文) │ 熵( entropy ) │
├───────────────────────────┼──────────────────────────────────────────┤
│ 毒血的头 │ 读写头( read/write head ) │
├───────────────────────────┼──────────────────────────────────────────┤
│ 山门 56 │ 山本五十六(日本海军大将) │
├───────────────────────────┼──────────────────────────────────────────┤
│ 积电器/寄电器 │ 继电器 │
├───────────────────────────┼──────────────────────────────────────────┤
│ 二子海默症 │ 阿尔茨海默症 │
├───────────────────────────┼──────────────────────────────────────────┤
│ 埃尼亚克/安尼阿克 │ ENIAC │
├───────────────────────────┼──────────────────────────────────────────┤
│ 爱德瓦克/爱尼瓦克 │ EDVAC │
├───────────────────────────┼──────────────────────────────────────────┤
│ αβ减值算法 │ α-β剪枝算法 │
├───────────────────────────┼──────────────────────────────────────────┤
│ ToroChamp │ Turochamp (图灵+钱珀诺恩合创的象棋程序) │
├───────────────────────────┼──────────────────────────────────────────┤
│ 布尔兹曼 │ 玻尔兹曼( Ludwig Boltzmann ) │
├───────────────────────────┼──────────────────────────────────────────┤
│ ACES │ ACE ( Automatic Computing Engine ) │
├───────────────────────────┼──────────────────────────────────────────┤
│ Unartificial Intelligence │ Artificial Intelligence │
├───────────────────────────┼──────────────────────────────────────────┤
│ 卷幅他 │ 本尼迪克特·康伯巴奇(卷福) │
├───────────────────────────┼──────────────────────────────────────────┤
│ 道胜和夫 │ 稻盛和夫 │
└───────────────────────────┴──────────────────────────────────────────┘

人名译名统一
- 冯诺一曼 → 冯·诺伊曼
- 斯马赫/司马赫 → 赫伯特·西蒙(中文名司马赫,首次出现做注)
- 纽娥尔 → 纽厄尔
- 赛米尔 → 阿瑟·塞缪尔

结构优化:去除 Speaker 标签,按四章结构整理为连贯叙述文章,保留播客的口语风格。
May 23
Replied to a topic by x1x2 分享创造 自用的音频转文字 Mac 应用
@kuhung Claude 的解释,你可以参考看看:

⏺ argmax-oss-swift 在 VoxNote 里负责两件事:语音识别( WhisperKit )和说话人识别( SpeakerKit )。

---
一、WhisperKit — 语音转文字的核心引擎

VoxNote 自己只负责把音频文件读成 [Float] 浮点数组( AudioProcessor.loadAudioAsFloatArray ),之后全部交给 WhisperKit:

[Float] 音频数据

whisperKit.transcribe(audioArray:decodeOptions:callback:segmentCallback:)

[TranscriptionResult] ← 含完整文本 + 每段时间戳

VoxNote 给 WhisperKit 的配置参数:
- chunkingStrategy: .vad — 自动按静音分段
- wordTimestamps: true — 保留每段的时间戳(供说话人对齐用)
- concurrentWorkerCount: 16 — 并行加速
- detectLanguage: language == nil — 不指定语言时自动检测

转录过程中 WhisperKit 会不断回调进度( 0%→98%)和中间文本,VoxNote 把这些映射成 UI 上的 .transcribing(progress, partialText) 实时显示。

---
二、SpeakerKit — 说话人识别(可选功能)

用户开启说话人标注后,VoxNote 会同时跑两个任务:

同一份 [Float] 音频
├─ 并行 → speakerKit.diarize() → DiarizationResult (谁在什么时间说话)
└─ 顺序 → whisperKit.transcribe() → [TranscriptionResult](说了什么)

合并 → diarization.addSpeakerInfo(to: results, strategy: .subsegment)

" [Speaker 1] 你好,请问……
[Speaker 2] 好的,我来解释一下……"

SpeakerKit 底层用的是 Pyannote v4 的 CoreML 模型,在本机完成推理,不联网。
May 23
Replied to a topic by x1x2 分享创造 自用的音频转文字 Mac 应用
@kuhung 我最开始用的苹果内置的引擎,后面扫了一眼这个开源项目: https://github.com/argmaxinc/argmax-oss-swift ,把内置模型改成了 Whisper large-v3
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3621 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 12ms · UTC 05:04 · PVG 13:04 · LAX 22:04 · JFK 01:04
♥ Do have faith in what you're doing.