跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-07-11精选AI 评分70

GigaChat Audio:支持120分钟输入的时间感知音频大语言模型

GigaChat Audio: Time-aware Large Audio Language Model

AI 导读

GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。

推荐理由

首个大规模时间感知音频LLM开源,把长音频问答的时间定位做到可验证,且附带完整数据集和消融分析,做语音产品的该认真看一下。

正文 · AI 翻译

{askutsakov, sadovinama, georgygospodinov, ae.maximenko, olegkutuzov01, bobrosoft98, minkin.fyodor}@gmail.com

摘要

在长录音中进行时间定位,对于音频条件的大语言模型而言仍然是一项挑战。我们提出了一种具有时间感知能力的音频大语言模型,能够针对长达 120 分钟的输入内容,回答带有明确时间戳的问题。我们的方法通过级联流水线产生的大规模合成监督数据,将周期性时间标记与连续音频模型 token 交错排列。该模型在短时和长时基准测试中均展现出强大的时间定位精度,并支持基于时间锚点的片段描述与摘要。大量消融实验考察了时间表示方式、标记频率、模型 token 化以及时长混合设计对精度和计算成本的影响。我们发布了模型权重和数据集,以支持时间感知音频理解的进一步研究,相关资源可在 https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B 获取。

关键词:

大型音频语言模型,音频问答,长语音处理

1 引言

会议、播客、讲座和呼叫中心日志等长录音,正越来越多地通过交互式界面被消费:用户提出问题、请求摘要并导航到特定证据。在这些场景中,时间定位并非锦上添花的功能,而是一种可验证性的基础:系统不仅应回答发生了什么,还应回答何时发生,使用户能够跳转到对应的音频片段。

近期,音频条件的大语言模型能够直接从语音和通用音频中遵循指令,包括专有模型 [1, 2] 和开源模型 [3, 4]。然而,长音频中的时间定位仍然不可靠:模型常常生成看似合理的内容,却输出无法解析的时间戳、过于粗略的时间引用或未经证实的时间断言。核心挑战在于,时间在标准音频模型 token 流中并非自然表示,而长录音则加剧了模型内部表示与面向用户的时间戳输出之间的不匹配。

本研究提出了三个实际问题:(一)在音频大语言模型的输入/输出接口中,表示时间的最小化且稳健的方式是什么?(二)对于时长较长的录音,人工标注成本过高,如何大规模生成时间维度的监督信号?(三)仅在单一时长范围上训练的时间模型能否泛化到其他长度?我们的实验显示出强烈的非对称性:仅在短音频上训练无法外推到长录音,而仅在长音频上训练则会降低短音频的性能(图3)。此外,周期性时间锚点对于长音频的定位至关重要:移除它们会导致长录音的准确率大幅下降(表1),不过在实践中,即使稀疏的锚点(例如每分钟一次)也足够使用(表3)。

我们提出了 GigaChat Audio,这是一个具有时间感知能力的音频条件大语言模型,支持长达 120 分钟的输入,并能生成带有明确时间戳的锚定回答、片段描述和摘要。我们的方法将连续的音频 token 与作为时间锚点的周期性时间标记交错排列。为了大规模训练时间维度的行为,我们引入了一个级联合成数据流水线,该流水线利用带时间戳的转录文本,通过切片来减少前置偏差,并使用全局验证器来确保一致性,从而生成监督信号。

  • •

    我们发布了一个支持长达 120 分钟输入的开源权重时间感知音频大语言模型。

  • •

    我们发布了一个新的超过 1 万小时的时序数据集,涵盖从秒级到小时级的录音,并带有用于时序问答和时间锚定摘要的监督信号。

  • •

    我们提供了一个高质量的长音频合成数据流水线,包含转录文本切片、验证以及通过多样本聚合进行的稳健评估。

  • •

    通过大量的消融实验,我们表明:(a)时间模型必须在混合音频长度上进行训练才能实现泛化;(b)时间锚点是必需的,锚点的频率/格式控制着准确率与计算量之间的权衡。

Refer to caption
图 1:时间感知音频大语言模型的架构。Token 流交错排列:文本 token、连续音频 token、时间 token(可以是文本形式的 hh:mm:ss 或特殊 token)。
Refer to caption
图2:用于时间定位的合成监督流程。音频经转录并对齐后,获得带时间戳的文本记录。对于问答类数据,我们抽取一段10分钟的转录片段并生成(问题,答案)对;验证器会对照完整带时间戳的转录记录逐一检查每个问答对,以确保全局一致性。我们在音频层面划分训练集/评估集(同一录音的所有问题均划分在同一数据集中)。评估时,我们使用仅生成答案的生成器为每个问题采样5个答案变体,然后进行聚合与筛选。

2 相关工作

现代多模态系统能够处理语音和音频输入的指令,包括GPT-4o [1]、Gemini [2]以及开源全能模型如Qwen3-Omni [4]和Voxtral [3]。早期的开源AudioLLMs [5, 6]展示了广泛的音频理解与对话能力。尽管这些模型支持转录和通用音频问答,但其时间定位行为——尤其是在长录音场景下——很少被单独剥离出来进行系统分析。

有若干系统专注于长语音识别和结构化富转录,并带有明确的说话人和时间信息,例如VibeVoice-ASR [7]和MOSS Transcribe Diarize [8]。WhisperX等工具可为长录音提供词级时间戳对齐 [9]。这些工作主要围绕以转录为中心的目标展开,而我们的目标是实现明确锚定在时间轴上的开放式问答与摘要生成。

时间定位此前已通过文本到音频定位基准 [10, 11] 在短音频事件上得到研究。近期基于LALM的方法,例如TimeAudio [12],引入了用于音频定位的显式时间建模。相关的检索式任务包括音频时刻检索(AMR)以及Clotho-Moment和CASTELLA [13, 14]等数据集。相比之下,我们聚焦于长录音(最长120分钟),并研究时间表示(锚点频率、格式和分词方式)以及用于长度泛化的时长混合训练等实际设计选择。

视频中的自然语言时刻定位为时序推理和定位提供了有益的启发[15],近期视频大语言模型通过引入时序分隔符token来改进定位能力[16, 17]。在评估开放式生成任务时,以LLM为裁判的评估协议已被广泛探索[18]。我们采用基于裁判的评估方法对定时摘要和片段描述进行评测,同时确保时序定位可通过区间重叠指标进行验证。

3 方法

3.1 模型

我们的模型是一个具备时间感知能力的音频大语言模型,通过在10B-A1.8B MoE文本检查点(支持256k token上下文窗口[19])前端接入音频模块构建而成,并在包含显式时间信号的音频SFT数据上进行微调(图1)。训练仅采用数据并行策略,未使用张量并行或序列并行。

我们采用编码器-子采样器-投影仪音频堆栈架构,结合FlashAttention[20]和编码器内的分块注意力机制(8秒块,40毫秒步长),以160毫秒帧率生成与文本嵌入空间对齐的连续音频嵌入向量。在音频编码器预训练阶段,我们沿用先前工作[22]中类似HuBERT[21]的设置,采用相同超参数,将先前训练的音频-LLM编码器生成的KMeans分布作为蒸馏目标,在M小时未标注多语言音频数据上进行训练。在音频SFT阶段,我们固定和参数。为使时间信息显式化,我们在连续的"音频token"之间插入时间间隔标记,形式为纯文本时间戳(hh:mm:ss)或专用时序token(见第4.3节),每60秒插入一次(时序频率详见第4.4节)。同时,在每个音频序列末尾附加最终的时间间隔标记。

媒体内容 · 前往原文查看
表1:跨任务和数据集的主要对比。我们评估了音频定位(AGr)、AMI语料库会议理解(AMI)、具备时间感知的DCASE音频问答(DAQA)、按时长分组的时序定位与定时描述,以及长格式定时摘要。对比对象包括开源模型(Qwen3-Omni-30B-A3B、TimeAudio)和闭源模型(Gemini 3 Flash),并通过去除时间间隔标记及其频率消融实验,来隔离周期性时间锚点的效果。
模型 AGr () AMI () DAQA () TGr (mIoU ) 描述 () 摘要(20–40分钟)
7–10秒 15–50分钟 6–10秒 0–1分钟 2–5分钟 20–40分钟 0–1分钟 2–5分钟 20–40分钟 Tm () AES () Rd ()
Qwen3-Omni-30B 50.8 290.5 1.00 47.2 27.3 3.6 3.95 3.70 2.11 43.7 74.3 24.9
TimeAudio 58.8 – 0.12 19.6 – – 1.41 – – – – –
Gemini 3 Flash 41.7 1.00 0.9 39.3 30.2 56.1 3.63 3.05 3.75 73.6 91.3 8.2
我们的方案(inter=60s) 45.1 3.50 1.70 40.6 53.0 53.8 3.63 3.76 3.83 76.7 88.1 16.9
使用 inter=7s 39.7 1.50 1.70 54.0 64.4 65.2 3.85 3.91 3.94 79.0 89.2 10.3
无时间间隔 24.5 66.0 3.20 38.1 34.0 14.2 3.54 3.49 2.67 69.2 87.5 48.4

3.2 基础音频后训练数据

基础音频后训练是在一个异构的SFT混合数据集上进行的,该数据集涵盖了音频描述、多轮对话、情感识别以及通用语音任务。音频描述数据涵盖通用领域、多语言和音乐音频,并同时使用描述性和问答式监督。对话数据包括语音上下文对话和打断。情感数据集为表演性语音提供离散的情感标签。通用任务包括多语言语音识别、多说话人处理、音频定位和TTS式监督。我们在时间感知消融实验中保持这个基础混合数据集不变,以隔离时间设计选择的影响。

3.3 时间感知任务

我们考虑了三种以时间为中心的生成任务。

时间定位要求模型通过预测音频中的时间区间来定位文本描述的事件;这与音频时刻检索密切相关[12, 13]。

片段描述以给定的时间区间为条件,生成该窗口内发生事件的自然语言描述;这类似于以预先分割的音频片段为条件的音频描述[24, 25],并且在应用于长音频时类似于语音摘要场景[12]。

带时间戳的摘要生成一个锚定在时间上的多部分摘要;与片段描述不同,模型还必须自行决定如何分段(即选择片段边界),而不是接收输入的分段。

3.4 音频和时间戳转录文本

我们从 YODAS2 的六个英语子集(24k 小时)[26] 出发,使用 SpeechBrain VoxLingua107 ECAPA-TDNN 语言识别模型筛选英语内容,仅保留通过筛选的样本(筛选后为 16k 小时)[27, 28]。随后,我们利用 WhisperX 获取词级时间戳和时间对齐的转录文本;同一对齐结果也用于估算静音比例 [9]。最后,我们根据静音比例阈值筛选录音(保留 14k 小时),按时长分桶(20 分钟以下、20–40 分钟、40 分钟以上),并平衡各桶的大小。

3.5 数据生成

图 2 总结了我们合成生成过程中大语言模型组件的运作方式,并以时间定位任务为例进行说明。长录音的处理方式是从 10 分钟转录文本切片中生成问答对,以减少问题生成中强烈的前置偏差(若不切片,问题会集中在录音开头部分)。我们使用纯文本的 GPT-OSS-120B [29] 基于带时间戳的转录文本生成合成数据,因为在我们的初步实验中,基于音频条件(音频+文本输入)的生成效果较差。一个独立的验证器会读取完整的带时间戳转录文本,并过滤掉不一致的生成结果。训练集/评估集在音频层面进行划分。对于评估集,我们额外针对固定问题提高采样温度,生成五个答案,并根据预测时间区间中位数重叠度的阈值过滤问题,从而在保留有挑战性样本的同时剔除错误示例。对于其他任务,聚合阶段基于大语言模型实现。具体而言,对于带时间戳的摘要生成任务,不进行片段采样:生成器一次性接收完整的带时间戳转录文本。

3.6 评估

我们聚焦于时间定位任务,因为它是可验证性最强的:预测结果可以通过区间重叠度进行评分,无需主观判断。我们报告以下指标:(i) 预测区间与参考区间之间的 mIoU(平均交并比),以及 (ii) MAE(中位绝对误差,以秒为单位)。对于区间输出,MAE 在区间中点处计算。对于片段描述和带时间戳的摘要,已知基于参考的标准自动指标与人工判断的相关性并不完美[30]。因此,我们采用大语言模型作为裁判的评估协议来评估这两项任务,该协议将模型的预测与参考答案进行比较,并可访问完整的带时间戳转录文本。

对于片段描述,裁判还会收到用户问题,并评估以下方面:(i) 事实准确性(对参考事实的覆盖程度),以及 (ii) 额外或矛盾信息(模型幻觉或冲突的陈述)。根据这些标准计算总体评分,并以 1-5 分的最终得分形式报告。

对于带时间戳的摘要,我们从四个维度进行评估:(1) Tm(时间结构)——时间顺序的正确性、分段的合理性与均衡性,以及时间块与语义的对齐程度;(2) Acc(事实准确性)——计算为参考事实(关键事实和次要事实分配不同的重要性权重)的加权覆盖率;(3) Err(错误与矛盾)——计算为候选事实按其重要性比例加权的错误率;以及 (4) Style(结构与风格)——逻辑组织、连贯性、简洁性和格式质量。此外,对于时间评估,我们报告一个自动指标,用于衡量整分钟分段的比例。如果一个分段的开始和结束时间戳相差整数分钟(例如 12:23-14:23),则该分段被视为整分钟分段;此类分段比例较高可能表明分段较为粗糙。

4 实验

4.1 跨任务与数据集的主要对比

表 1 总结了在四个基准上的性能表现:

  1. (i)

    AudioGrounding [10]。短片段数据集(980 个样本,7-10 秒)。问题涉及声学事件,模型预测一个时间区间。我们报告 mIoU 指标。

  2. (ii)

    AMI 会议语料库 [32]。会议录音(时长 15–50 分钟),附带词级时间戳。我们自动生成了 150 个短语级问题,针对 3–5 秒的语音片段(“这段短语是在什么时候说的?”)。我们报告区间平均绝对误差(MAE)。

  3. (iii)

    DCASE 音频问答(时间感知子集)[11]。多选题数据集;我们选取了“开始时间是什么……”形式的问题,最终得到 144 个样本(时长 6–10 秒),答案形式为时间值,例如 5.2 秒。我们报告逐点平均绝对误差(MAE)。

  4. (iv)

    我们的基准测试涵盖三项任务。对于时间定位,我们报告 mIoU;对于片段描述,我们使用大语言模型作为评判者的总体评分指标(详见第 3.6 节)。对于定时摘要,我们报告三个指标:Tm——基于评判者的时序结构评分;AES——聚合内容评分,计算公式为 ,其中 Acc、Err 和 Style 是上述大语言模型评判者对应的维度;Rd——整段片段占比,即时长是 60 秒整数倍的片段所占比例。结果按时长分组(0–1 分钟、2–5 分钟、20–40 分钟);摘要仅在最长时长分组上进行评估。

我们在可用的情况下纳入了开放多模态基线模型。在我们的内部评估中,TimeAudio [12] 在处理超过两分钟的音频时性能下降,频繁输出 UNK 和无法解析的时间戳。因此,我们仅在其基准测试时长与原始设置匹配时报告其结果。表 1 突出显示,在短片段上表现优异的模型无法将其能力迁移到长时时间定位上(例如,Qwen3-Omni 在 20–40 分钟 TGr 任务上 mIoU 降至 3.6,在 AMI 数据集上区间 MAE 为 290.5 秒)。相比之下,我们的模型在时长增加时仍能保持稳定的定位精度(20–40 分钟时 mIoU 为 53.8),并且每 7 秒插入一次时间锚点后性能进一步提升(mIoU 达到 65.2)。与自身消融实验的差距证实了时间间隔锚点的关键作用:移除周期性时间锚点后,长时 mIoU 从 53.8 降至 14.2,同时定时描述和摘要的性能也出现下降。接下来,我们将系统研究时间间隔锚点的最优频率和文本编码方式。

4.2 长度外推

Refer to caption
图 3:时间定位任务中长达 120 分钟的长度外推性能(mIoU)。行表示训练时长窗口,列表示评估音频长度。阴影按列归一化,反映每个评估时长内的相对质量。

我们评估了在特定时长范围内训练的模型如何泛化至长达 120 分钟的不同长度(图 3)。模型检查点在不同时长区间(行)上训练,并在共享的时长网格(列)上评估。我们观察到非对称泛化:仅在短音频上训练的模型无法处理长录音,而仅在长音频上训练的模型会损害短音频性能。为确保数据干净分离,我们丢弃了早期录音中的问题(例如,对于 10–20 分钟的评估,答案必须出现在第 10 分钟之后)。在所有时长上训练的模型在几乎所有音频长度上的表现均优于其他训练方案。

4.3 特殊时间 token 与时间比例缩放

我们测试了引入专用时间戳 token 是否能改善定位效果。我们保留 hh:mm:ss 的表面格式,但将其字符替换为特殊时间 token,这些 token 从对应数字和冒号 token 的嵌入向量初始化。表 2 显示,这些额外 token 需要在 SFT 中占据更大的时间 token 比例才能达到纯文本基线的水平;只有在非常高的时间比例下,它们才能达到可比的 mIoU。

媒体内容 · 前往原文查看
表 2:特殊时间 token 与时间数据比例。我们报告了使用纯文本(常规)和特殊(额外)时间 token 训练的模型,在音频 SFT 混合数据中不同时间定位(TG)数据比例下的 mIoU。
TG 数据比例 2.4% 4.8% 9.1% 16.7% 33.4% 50.0%
常规 token 41.4 50.9 52.5 57.5 – –
额外 token – 13.1 37.6 50.0 55.2 56.8

4.4 时间间隔频率

时间间隔作为周期性锚点插入到输入流中。表 3 显示,更频繁的锚点能改善定位效果,但代价是增加额外 token。即使使用 60 秒的锚点间隔,模型的中位误差仍可达到 3 秒(而 7 秒锚点间隔的中位误差为 1.5 秒),这相当于在分钟级锚点之间有效插值出秒级精度。

媒体内容 · 前往原文查看
表 3:帧间时间频率权衡。针对不同锚点间隔,报告了 mIoU 和 MAE(以秒为单位,基于区间中点)。附加比例显示了在 160 毫秒帧率下,时间 token 相对于音频 token 的占比。
频率 7 秒 15 秒 30 秒 60 秒 120 秒 240 秒
mIoU () 63.0 59.9 55.5 50.9 41.3 31.0
MAE () 1.5 2.0 2.5 3.0 5.0 8.5
附加比例 16.0% 7.5% 3.7% 1.9% 0.9% 0.5%

4.5 帧间时间格式

如果每分钟设置一个锚点,标准的 hh:mm:ss 格式可能会产生大量 token(例如 00:01:00)。我们比较了在不改变语义的前提下缩短标记的替代编码方案。表 4 显示,纯秒数格式会显著降低性能,而分钟索引格式在 token 开销低得多的情况下,性能仍接近 hh:mm:ss 格式。

媒体内容 · 前往原文查看
表 4:帧间时间标记格式(每 60 秒一个标记)。我们报告了针对帧间时间标记的不同文本编码方案的时间定位性能。
格式 hh:mm:ss m:0 m: m 秒
mIoU 50.9 47.1 43.8 44.5 20.9

5 结论

我们提出了一种具有时间感知能力的音频大语言模型,该模型支持长达 120 分钟的输入,并能生成明确锚定于时间轴的答案和摘要。我们的结果表明,在长录音中进行时间定位仍然是现有多模态模型的主要瓶颈,这些模型在处理超过几分钟的音频后性能通常会急剧下降。我们证明了周期性时间锚点(帧间时间)对于稳定的长时定位至关重要,即使稀疏的锚点(例如每分钟一次)也足以实现可靠的定位,并且针对不同音频时长的混合数据进行训练是实现长度泛化所必需的。除了模型本身,我们还发布了一个超过 10,000 小时的数据集,涵盖从秒级到小时级的录音,用于时间问答和带时间戳的摘要任务,旨在促进对时间感知音频理解的进一步研究。

6 生成式 AI 使用声明

在稿件准备过程中,生成式 AI 工具被用于有限的语言编辑(语法、清晰度和风格润色)。所有输出结果均由作者仔细审查、编辑和验证,作者对最终内容承担全部责任。如第 3.5 节和第 3.6 节所述,大语言模型在实验框架内被用于:(i) 从带时间戳的转录文本生成合成监督信号,以及 (ii) 作为大语言模型评判器(LLM-as-a-judge)评估器,用于片段描述和定时摘要。生成式 AI 工具未用于提出科学主张、解释结果或确定研究结论。

参考文献

  • [1] OpenAI,《GPT-4o 系统卡》,2024 年。[在线]。网址:https://arxiv.org/abs/2410.21276
  • [2] Gemini Team,Google,《Gemini 2.5:以高级推理、多模态、长上下文和下一代智能体能力推动前沿》,2025 年。[在线]。网址:https://arxiv.org/abs/2507.06261
  • [3] A. H. Liu 等人,《Voxtral》,2025 年。[在线]。网址:https://arxiv.org/abs/2507.13264
  • [4] J. Xu 等人,《Qwen3-omni 技术报告》,2025 年。[在线]。网址:https://arxiv.org/abs/2509.17765
  • [5] Y. Chu, J. Xu, Q. Yang, H. Wei, X. Wei, Z. Guo, Y. Leng, Y. Lv, J. He, J. Lin, C. Zhou, 和 J. Zhou,《Qwen2-audio 技术报告》,2024 年。[在线]。网址:https://arxiv.org/abs/2407.10759
  • [6] C. Tang, W. Yu, G. Sun, X. Chen, T. Tan, W. Li, L. Lu, Z. Ma, 和 C. Zhang,《SALMONN:迈向大语言模型的通用听觉能力》,2024 年。[在线]。网址:https://arxiv.org/abs/2310.13289
  • [7] Z. Peng 等人,《VIBEVOICE-ASR 技术报告》,2026 年。[在线]。网址:https://arxiv.org/abs/2601.18184
  • [8] MOSI.AI,《Moss transcribe diarize 技术报告》,2026 年。[在线]。网址:https://arxiv.org/abs/2601.01554
  • [9] M. Bain, J. Huh, T. Han, 和 A. Zisserman,《WhisperX:长音频的高时间精度语音转录》,收录于《Interspeech 2023》,2023 年,第 4489–4493 页。
  • [10] X. Xu, H. Dinkel, M. Wu, 和 K. Yu,《文本到音频定位:构建字幕与声音事件的对应关系》,载于《ICASSP 2021 - 2021年IEEE国际声学、语音与信号处理会议(ICASSP)》,2021年,第606–610页。
  • [11] C.-H. H. Yang, S. Ghosh, Q. Wang, J. Kim, H. Hong, S. Kumar, G. Zhong, Z. Kong, S. Sakshi, V. Lokegaonkar, O. Nieto, R. Duraiswami, D. Manocha, G. Kim, J. Du, R. Valle, 和 B. Catanzaro,《面向DCASE 2025挑战赛的多领域音频问答:实现声学内容推理》,2025年。[在线]。网址:https://arxiv.org/abs/2505.07365
  • [12] H. Wang, Y. Li, S. Ma, H. Liu, 和 X. Wang,《倾听帧间之声:弥合大型音频语言模型中的时间鸿沟》,2025年。[在线]。网址:https://arxiv.org/abs/2511.11039
  • [13] H. Munakata, T. Nishimura, S. Nakada, 和 T. Komatsu,《基于语言的音频时刻检索》,载于《ICASSP 2025 - 2025年IEEE国际声学、语音与信号处理会议(ICASSP)》,2025年,第1–5页。
  • [14] H. Munakata, T. Imamura, T. Nishimura, 和 T. Komatsu,《CASTELLA:带字幕和时间边界的长时间音频数据集》,2026年。[在线]。网址:https://arxiv.org/abs/2511.15131
  • [15] L. A. Hendricks, O. Wang, E. Shechtman, J. Sivic, T. Darrell, 和 B. Russell,《利用时间语言定位视频中的时刻》,载于《2018年自然语言处理经验方法会议论文集》,E. Riloff, D. Chiang, J. Hockenmaier, 和 J. Tsujii 编。比利时布鲁塞尔:计算语言学协会,2018年10月-11月,第1380–1390页。[在线]。网址:https://aclanthology.org/D18-1168/
  • [16] S. Chen, X. Lan, Y. Yuan, Z. Jie, 和 L. Ma,《Timemarker:一种多功能视频大语言模型,具备卓越的时间定位能力,适用于长视频和短视频理解》,2024年。[在线]。网址:https://arxiv.org/abs/2411.18211
  • [17] M. L. Team, Bayan, B. Li, 和 B. L. 等人,《Longcat-flash技术报告》,2025年。[在线]。网址:https://arxiv.org/abs/2509.01322
  • [18] Y. Liu, D. Iter, Y. Xu, S. Wang, R. Xu, 和 C. Zhu, “G-eval:使用 GPT-4 进行 NLG 评估,具有更好的人类对齐性,”载于《2023 年自然语言处理经验方法会议论文集》,H. Bouamor、J. Pino 和 K. Bali 编。新加坡:计算语言学协会,2023 年 12 月,第 2511–2522 页。[在线]。网址:https://aclanthology.org/2023.emnlp-main.153/
  • [19] ai-sage,“GigaChat3-10B-A1.8B,”https://huggingface.co/ai-sage/GigaChat3-10B-A1.8B,2025 年,Hugging Face 模型卡;访问日期:2026-02-25。
  • [20] T. Dao,“FlashAttention-2:通过更好的并行性和工作分区实现更快的注意力机制,”载于《第十二届国际学习表征会议》,2024 年。[在线]。网址:https://openreview.net/forum?id=mZn2Xyh9Ec
  • [21] W.-N. Hsu、B. Bolte、Y.-H. H. Tsai、K. Lakhotia、R. Salakhutdinov 和 A. Mohamed,“Hubert:通过隐藏单元的掩码预测进行自监督语音表征学习,”《IEEE/ACM 音频、语音与语言处理汇刊》,第 29 卷,第 3451–3460 页,2021 年。
  • [22] A. Kutsakov、A. Maximenko、G. Gospodinov、P. Bogomolov 和 F. Minkin,“GigaAM:用于语音识别的高效自监督学习器,”载于《Interspeech 2025》,2025 年,第 1213–1217 页。
  • [23] N. Shazeer、A. Mirhoseini、K. Maziarz、A. Davis、Q. Le、G. Hinton 和 J. Dean,“规模大得离谱的神经网络:稀疏门控混合专家层,”2017 年。[在线]。网址:https://arxiv.org/abs/1701.06538
  • [24] K. Drossos、S. Lipping 和 T. Virtanen,“Clotho:一个音频描述数据集,”载于《ICASSP 2020 - 2020 年 IEEE 国际声学、语音与信号处理会议(ICASSP)》,2020 年,第 736–740 页。
  • [25] C. D. Kim、B. Kim、H. Lee 和 G. Kim,“AudioCaps:为野外音频生成描述,”载于《2019 年北美计算语言学协会人类语言技术会议论文集,第 1 卷(长文与短文)》,J. Burstein、C. Doran 和 T. Solorio 编。明尼苏达州明尼阿波利斯:计算语言学协会,2019 年 6 月,第 119–132 页。[在线]。网址:https://aclanthology.org/N19-1011/
  • [26] X. Li, S. Takamichi, T. Saeki, W. Chen, S. Shiota 和 S. Watanabe,《Yodas:面向音频与语音的 YouTube 数据集》,载于《2023 年 IEEE 自动语音识别与理解研讨会,ASRU 2023》系列丛书。电气与电子工程师学会,2023 年,出版者版权:© 2023 IEEE;2023 年 IEEE 自动语音识别与理解研讨会,ASRU 2023;会议日期:2023 年 12 月 16 日至 20 日。
  • [27] T. Parcollet、M. Ravanelli、P. Plantinga、A. Rouhe、S. Cornell、L. Lugosch、C. Subakan、N. Dawalatabad、A. Heba、J. Zhong、J.-C. Chou、S.-L. Yeh、S.-W. Fu、C.-F. Liao、E. Rastorgueva、F. Grondin、W. Aris、H. Na、Y. Gao、R. de Mori 和 Y. Bengio,《SpeechBrain:通用语音工具包》,2022 年 3 月,预印本。[在线]。网址:https://hal.science/hal-03601303
  • [28] J. Valk 和 T. Alumäe,《Voxlingua107:用于口语语言识别的数据集》,《2021 年 IEEE 口语语言技术研讨会 (SLT)》,第 652–658 页,2020 年。[在线]。网址:https://api.semanticscholar.org/CorpusID:227209238
  • [29] OpenAI、S. Agarwal、L. Ahmad、J. Ai、S. Altman、A. Applebaum 等人,《gpt-oss-120b 与 gpt-oss-20b 模型卡》,2025 年。[在线]。网址:https://arxiv.org/abs/2508.10925
  • [30] H. Nguyen、H. Chen、L. Pobbathi 和 J. Ding,《文本摘要质量评估方法的比较研究》,《ArXiv》,第 abs/2407.00747 卷,2024 年。[在线]。网址:https://api.semanticscholar.org/CorpusID:270869494
  • [31] A. R. Fabbri、W. Kryscinski、B. McCann、R. Socher 和 R. D. Radev,《Summeval:重新评估摘要评估》,《计算语言学协会汇刊》,第 9 卷,第 391–409 页,2020 年。[在线]。网址:https://api.semanticscholar.org/CorpusID:220768873
  • [32] J. Carletta,《释放杀手级语料库:创建多维度 AMI 会议语料库的经验》,《语言资源与评估》,第 41 卷,第 2 期,第 181–190 页,2007 年。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org