Quantcast
Channel: 声网
Browsing index pages (295 articles)

Image may be NSFW.
Clik here to view.

2026年世界杯倒计时:声网赛事直播解决方案深度解析

2026年6月,史上规模最大的一届世界杯将在美国、加拿大、墨西哥三国同步举行。48支球队、104场比赛、跨越三个时区、覆盖全球数十亿观众,这不仅是一场足球盛宴,更是对每一个提供赛事直播服务的平台的极限压测。 带宽峰值会在进球瞬间被打穿,卡顿投诉会在点球大战期间爆发,弹幕剧透会让延迟过高的平台成为话题靶子。世界杯,是赛事直播技术能力的终极考场。...

View Article


Image may be NSFW.
Clik here to view.

语聊房和直播间有什么区别:技术架构与场景选型

接到”做多人实时音频互动”的需求,开发者通常得先确定一件事:用语聊房架构,还是用直播间加连麦?两种形态在产品表现上有时候很像,但底层走的是完全不同的技术路径。 一. 协议层的根本差异 语聊房用 RTC(Real-Time Communication)通道,底层是 UDP 传输,为低延迟实时通信设计。直播间用 CDN 推拉流,主播通过 RTMP 协议向 CDN 推流,观众拉 HLS 或 FLV...

View Article


Image may be NSFW.
Clik here to view.

2026年5月三大开源语音合成模型TTS推荐与测评

文本转语音(TTS)领域在2025-2026年迎来了爆发式进展。端到端神经网络模型彻底取代了拼接式合成,开源社区涌现出一批音质接近商业方案、可免费私有化部署的强大模型。本文对主流开源TTS模型进行完整横评,覆盖音质、速度、中文能力、资源消耗和使用场景,帮你找到最适合自己需求的语音合成引擎。 一. 文本转语音(TTS)技术解析和应用...

View Article

Image may be NSFW.
Clik here to view.

2026年5月最值得关注的10个开源Agent平台

AI Agent 正在从实验室走向生产环境。2026年,选择一个合适的开源Agent平台已经成为每个AI工程师和产品团队的必修课。本文系统评测10大主流开源Agent平台,覆盖核心能力、上手难度、适用场景与免费程度,帮你直接做出决策。 一. 什么是Agent平台?选型前先搞清楚这三个层次 Agent平台通常分三个层次:...

View Article

Image may be NSFW.
Clik here to view.

2026年5月 GitHub 最受欢迎的十大开源 AI 项目全解析

从 2026 年初至今,AI 开源生态发生了剧烈变化。GitHub 上的热门项目已不再是年初的 MCP 工具集,而是转向了更加实用的自主 Agent 系统、开发者工具链和多模态生成平台。本文基于 GitHub 最新数据(截至 2026 年 5 月 22 日),对当前最受关注的十大 AI 开源项目进行深度解析。...

View Article


Image may be NSFW.
Clik here to view.

吉利 × 赋之 × 阶跃星辰 × 瑞芯微 × 声网:春夏巡游拆解消费级机器人核心布局

5月16日,声网 RTE 2026 春夏巡游首站在深圳落地。沙龙主题是「消费级机器人的多模态交互“实时进化论”」。 我们邀请了吉利汽车研究院、赋之科技、阶跃星辰、瑞芯微的嘉宾现场分享干货内容。场外,赋之、陆吾、二白等机器人产品以及各类开发板开放体验,让到场同行在聆听分享的同时,也能亲手感受当前消费级机器人的真实交互。 以下是五位嘉宾分享的精彩节选。 吉利杨硕:车是中枢,“贾维斯”才是灵魂...

View Article

Image may be NSFW.
Clik here to view.

深度访谈:OpenAI 如何打破常规,构建基于 WebRTC 的大规模实时语音 AI 架构

近期,OpenAI 发布了一篇关于他们如何在大规模下实现低延迟语音 AI 的技术博客,引发了业内的广泛关注。在 WebRTC.ventures 最新的一期访谈中,业内专家 Tsahi 对这篇博客进行了深度解读。这段视频访谈讨论了 OpenAI 最近公开的 WebRTC 架构设计,强调了其在语音 AI 领域的技术突破。...

View Article

Image may be NSFW.
Clik here to view.

Agent Skills 开发者指南:8 个最值得关注的开源仓

最近更新:2026年5月22日 Agent Skills 正在成为 AI 原生开发的基础设施。自 Anthropic 于2025年12月将 Skills 标准开放以来,Claude Code、OpenAI Codex、Gemini CLI、Cursor 等主流平台相继兼容,这意味着一份写好的 SKILL.md,可以跨平台复用你的工作流。 GitHub 上与 Skills...

View Article


全双工交互模型TML-Interaction-Small:0.40秒轮次延迟,FD-bench 超 GPT 和 Gemini

前 OpenAI CTO Mira Murati 在2025年2月创立Thinking Machines Lab,完成了20亿美金种子轮融资(1200亿美金估值),是历史上最大的种子轮之一。公司2025年10月发布了第一个产品Tinker(模型微调工具),此后保持低调。5月11日,他们拿出了第二个产品:TML-Interaction-Small。 这不是一个常规的语音模型更新。Thinking...

View Article


Image may be NSFW.
Clik here to view.

SD-RTN的全球节点调度算法:如何实现毫秒级延迟

一场跨国视频会议,北京的产品经理、纽约的工程师、伦敦的设计师同时在线,画面流畅,声音清晰,几乎感觉不到延迟。这背后,是全球数百个数据中心在协同工作,实时计算着最优的数据传输路径。...

View Article

Image may be NSFW.
Clik here to view.

Google I/O 2026:从 XR 眼镜到 Gemini,语音交互成绝对核心

Google I/O 2026明天(5月19日)开幕。过去几年,I/O已经不太像一个发布会,更像是Google每年一次对行业说“我们接下来押哪里”的公开表态。今年的信号,在开幕前就已经很清楚了。 一. 最值得关注的硬件:Android XR眼镜 这次I/O最受期待的硬件不是手机,是眼镜。Google已官方确认,两款Android...

View Article

Image may be NSFW.
Clik here to view.

什么是 SD-RTN 实时传输网络?

打开一个直播间,主播说话的声音几乎同步传到你的耳朵里。和远在地球另一端的同事开视频会,画面流畅得像面对面交谈。这些看似理所当然的体验,背后都依赖着一个关键问题的解决:如何让数据在复杂的互联网环境中,既快又稳地到达目的地? 传统的互联网基础设施是为网页浏览、文件下载这类场景设计的。延迟几秒钟,用户可能不会察觉。但实时音视频不一样,长时间的延迟就能让对话变得尴尬,让互动变得困难。这就是 SD-RTN...

View Article

Image may be NSFW.
Clik here to view.

AI 编程费用居高不下?三款开源工具大幅削减 Token 开销

用 Claude Code 跑一个中等规模的 TypeScript 或 Rust 项目,cargo test的完整输出约4800个 token,git status约2000个,ls -la约3200个。Agent实际需要的信息只是其中一小部分——测试过没过、有没有未提交的文件。剩下的全是噪声,但照样占你的配额。 Cursor有credits上限,Aider按token计费,Gemini...

View Article


Image may be NSFW.
Clik here to view.

HRTF vs Ambisonics:两种3D音频技术的对比

HRTF(Head-Related Transfer Function)和Ambisonics代表了3D音频技术的两种不同哲学。HRTF是”以听者为中心”的技术,通过模拟声音到达人耳的过程生成双耳音频;Ambisonics是”以声场为中心”的技术,用球谐函数描述整个三维声场,可以灵活渲染到任何播放系统。...

View Article

Image may be NSFW.
Clik here to view.

什么是HRTF?如何让耳机实现3D音效

HRTF(Head-Related Transfer Function,头部相关传输函数)描述了声音从空间中某个位置传播到人的左右耳朵时,因头部、耳廓、肩膀的阻挡和反射而产生的频谱变化。这些变化包含了声音的方位信息,大脑通过解读这些信息来判断声源位置。...

View Article


Image may be NSFW.
Clik here to view.

双耳渲染技术详解:从单声道到3D音效的演进

双耳渲染(Binaural Rendering)是一种音频处理技术,通过计算声音从空间中特定位置传播到左右耳朵的过程,生成包含完整空间信息的双声道音频。当用户戴上耳机播放时,大脑会将这些线索解读为三维空间中的声源方位,实现”听音辨位”的效果。...

View Article

Image may be NSFW.
Clik here to view.

什么是3D空间音频?如何在RTC中实现沉浸式音频体验?

3D空间音频(Spatial Audio)是一种模拟真实世界声音空间特性的音频技术,通过计算声源位置、距离和方向,让用户感知到声音从特定方位传来,并随着用户和声源的相对位置变化而动态调整。在实时音视频通信(RTC)中,空间音频能够创造”面对面交流”的沉浸感。...

View Article


Image may be NSFW.
Clik here to view.

什么是Simulcast多流传输?如何优化多人视频会议体验

Simulcast 是实时音视频通信中的一种带宽优化技术,发送端同时编码并发送多个不同分辨率的视频流(如1080p、720p、360p),接收端根据自身网络带宽、设备性能和显示区域大小,动态选择最合适的流进行接收和解码。...

View Article

Image may be NSFW.
Clik here to view.

OpenAI重构WebRTC架构:Relay+Transceiver如何支撑9亿用户毫秒级语音交互?

2026 年 5 月初,OpenAI 工程师 Yi Zhang 和 William McDonald 在官方博客发布了一篇罕见的基础设施技术披露,详细介绍了支撑 ChatGPT Voice 和 Realtime API 的 WebRTC 架构重构方案。这是 OpenAI 首次公开实时语音交互的底层技术细节。 当前该架构已全量部署上线,支撑超过 9...

View Article

Image may be NSFW.
Clik here to view.

上海市市长龚正为声网授牌上海市创新型企业总部

4月28日,第三批上海市创新型企业总部授牌仪式正式举行,仪式上,常务副市长吴伟宣读第三批创新型企业总部名单。上海市市长龚正为声网颁授上海市创新型企业总部荣誉奖牌,声网首席商业官崔博接牌。...

View Article
Browsing index pages (295 articles)


Latest Images