{"as_of":"2026-08-05T12:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:976d6511538ab548b2d6017c9c4d30e2608e3db05f40cb804b032a4d7dada074","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T12:07:39.817307Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T12:07:39.817307Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.10387","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Earlier open AudioLLMs [5, 6] demonstrate broad au- dio understanding and dialogue capabilities","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2607.10387","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:19635eaf427c18935c70877d9119f620c865237cbe7cfdf38462365fdc0b0603","observation_id":"33842f2d-04d1-407b-b38c-889770613c08","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.10387/citation-record","integrity":"/paper/2607.10387/integrity","json":"/paper/2607.10387/citation-record.json","paper":"/paper/2607.10387"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:efa9b1cfb99374dd362906cdd14de37b5ddbd33f9d6ffb94290840292120a077","observation_id":"f168dcb9-4262-47a4-a1f4-11ec0dcf65f5","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.10387","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Earlier open AudioLLMs [5, 6] demonstrate broad au- dio understanding and dialogue capabilities","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2607.10387","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:19635eaf427c18935c70877d9119f620c865237cbe7cfdf38462365fdc0b0603","observation_id":"33842f2d-04d1-407b-b38c-889770613c08","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"audio tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:099ea8cef7273de8d64fff5e31b1db542d6fe080b52041346f293ad741223b03","observation_id":"0b0536fe-e30e-4ccc-a413-ea01700fdf23","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"We then obtain word-level timestamps and time-aligned transcripts us- ing WhisperX; the same alignment is also used to estimate the silence ratio [9]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:953b3fece0bb322284bdc209b3dd0434d8131dbafc2fa87f42418287fc397e75","observation_id":"5957e482-b7cc-406f-88d5-a7ba160f0804","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"when was this phrase spoken?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:9ef52135268689f83a186cb78648994d86165918b99d49c575f7aca6f560065b","observation_id":"19afe744-d780-4268-9e35-1c05d1bbffed","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Our results show that temporal ground- ing in long recordings remains a major bottleneck for exist- ing multimodal models, which often degrade sharply beyond a few minutes of audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:1c79e54a3a04f3b0bf039ccca76a9ba667abcf078f22017666bf387d923cdce7","observation_id":"7fcfa865-2e5b-41ff-9676-d7d5ea0ddc21","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"All outputs were carefully reviewed, edited, and validated by the authors, who take full responsibility for the fi- nal content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:5c945b94e2776fc8cf45e274cb08cf58d3657441e5570a8ada34de9a3dc1df78","observation_id":"22d5a6be-3f2b-462a-b693-dec2037c2a68","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:fb9b33af649465033fc8357506856fa4d144c6b7aa0437654b1941c0e77a7995","observation_id":"67ee9c40-d3e6-4413-9091-9f65e56682f5","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:773c16f07d99af2a775aabfea3c69c5754cf6d55ee74f6ef3026c326f2d2aa1a","observation_id":"4edbcfc4-8f24-4d2f-9deb-0d23d01d9a9f","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:4acacf98a3baaa135e2b8cd01df77acfcdc34e0aa6c30bdd23218450669cf195","observation_id":"382579c1-70e4-4e99-9485-5309bbe4cacb","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Qwen3-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:6a3f9505ab5499f83d96b21b72fcae5e7c13bb5115f91553e1a7c47edbc8e061","observation_id":"181f658a-4ba8-4757-9d4c-c87aa2351753","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:d74c2b613ad3e4d9e47df3c015834337c9a5f9469f80913f46d8cb8a1f97b109","observation_id":"23072848-deb8-4ca2-822c-398e9065bf9e","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:2589f93f2bf7d4d4a30bcf65ac0a887d50cd32b07c92ee08f529bd11690ea60e","observation_id":"b33910b4-a0e7-41e4-be13-d211839ecf5c","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"VIBEVOICE-ASR technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:06ade5d3bf9a9e65ef8432425125d64d6ed718dbeddb23af7810807600d53954","observation_id":"0e0ec7e5-e52a-43af-9672-b2ebe74c0948","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.01554","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Moss transcribe diarize technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2601.01554","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:a10bc158929a9eabddd17afbcb994b41408c90bdbe92a54bd6e64ead2872be98","observation_id":"956adcb4-f2cb-4e1f-991c-50c6418120c3","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"WhisperX: Time- Accurate Speech Transcription of Long-Form Audio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:802928f90b0aef8b2c9c3302b0b01131d8cf9b3aa307a8731cbbc1f7a893a6b1","observation_id":"0d20c44b-129d-4788-8e73-21dec973487c","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Text-to-audio grounding: Building correspondence between captions and sound events,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:55f97f1057a6f81bbfc40640256869fd4845411417a3d28f3fe8a9b547ccc669","observation_id":"64470285-107b-4ffa-905e-a9d43e62a6f4","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Multi-domain audio question answering toward acoustic content reasoning in the dcase 2025 challenge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:2de706cd98c755f813885326df3404cfa14e45ba72ab36c2cd2c6d8bc899895f","observation_id":"bddfef2b-46c1-47e4-aa6f-8dd1f15e28a0","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Listening between the frames: Bridging temporal gaps in large audio-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:c2662eb3f2dae1e5d1ab12b4d6c6c243bb7f92a12884805ed08adaf0cb48f6bf","observation_id":"f734a812-218c-4b59-8c57-19d28005e72b","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Language-based audio moment retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:1c2651cc6f8f9ee69156da5c87b884c233958211290030a2988980ff5ddf75d4","observation_id":"63f9c7df-9395-4267-ad9c-5e4646563e15","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"CASTELLA: Long audio dataset with captions and temporal boundaries,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:4d243253b4a50e9b71dea6fb75ced3443b3cb93e4b70b3c20223326fb8b56a04","observation_id":"d4936fe5-da6b-43c1-9f01-6b0d1f8faf95","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Localizing moments in video with temporal language,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:6373de689c77dcffbfb918538b970a5c3f4d912335a2ec5ca556eb2b2ef76f44","observation_id":"2967d62b-6b03-4505-9015-7fb120dc3c0a","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localization ability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:9309eaffa4fa5e75dc8ccf7d4b3a86ef699cbf509b5639b92c7a0788ef08df23","observation_id":"cd481eea-dbef-44cf-822a-b25a6070bf61","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Longcat- flash technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:8c779223a803ef0b6ecc4327dfa275a48bcd25232cc97ae73a6c75700f313086","observation_id":"5fde91ef-89e5-45eb-9c5e-fe6bed15d4b4","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"G-eval: NLG evaluation using gpt-4 with better human alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:029f8d173dafafe2541ce126fd5266da56463d7f8322b7083672da99c30f93f2","observation_id":"51d056bb-fd5f-4617-8f28-3514bbe4cb5e","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"GigaChat3-10B-A1.8B,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:4de6af22458858f0d65ec58e88ade6dc5aff64b59a58b4a060947af0f5fc0cbf","observation_id":"cd975aea-fda3-4cb8-b2b1-a0fdb6c440ad","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:1f8fa7e20701bfd0b88274bc32c4f75ba27fce37887f5aa326d9252a1480eb21","observation_id":"a71ceff2-d8d6-4a2f-bd46-c29657062437","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Hubert: Self-supervised speech rep- resentation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:a8a4ccce6bc69e939904195ce1f0317ecd17d75c4d53639e7e4f88190691abf4","observation_id":"1b446f7d-8518-464d-9423-86fdcdd879f6","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"GigaAM: Efficient Self-Supervised Learner for Speech Recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:77967f7be6663a8c4bf8720d13f7cbe2f4ff0be03462d4f2a150ee9fddac9810","observation_id":"dd718bb8-c590-4123-a3d2-88cf791bee38","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:578d545aeff841bfe6fb598ec3217b20183f1c411127ddb1a9341cde856814a5","observation_id":"95994720-37d4-4408-a38a-7a12968103e2","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Clotho: an audio cap- tioning dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:0027b0bf1053527a624af0a87d1d8bebc95201e2ecdd3b984768cec2424d1b92","observation_id":"cfcd6b06-7d83-41d5-a102-c0c0ac659c87","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:8a5a6055aa0027003ccb14a1a6c89dcc3365a50770f00a9932df5d8e1c515d3b","observation_id":"7915f50a-b080-4559-bcef-400df359bc7e","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Yodas: Youtube-oriented dataset for audio and speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:0d002766636fe6949e3a257be2fa2a879a5844c254f6f944dab31c311696f45f","observation_id":"b981f732-048d-4360-9f6d-2323a0a1bf93","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"SpeechBrain: A General-Purpose Speech Toolkit,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:a8615b79eb24e764deb74b13450ab66a820af63fb1b8d76faf6fd27487bc5a31","observation_id":"5c1a9d04-01cb-4ef9-8643-d964f6798f57","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"V oxlingua107: A dataset for spoken language recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:0238fbbf6cd71ad3cc015d362daf7b94bfba725afaf610044fbb18842d4c17a3","observation_id":"808dd49e-80f2-4d31-90a6-256d5f8f1a9e","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"gpt-oss-120b & gpt-oss-20b model card,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:4ee40009da544b490d6fc98e2cef140028fb73086217a372b8d64192873be409","observation_id":"d3ca7311-6920-44be-962a-65090d8088f6","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00747","last_updated":"2024-06-30T16:12:37Z","snapshot_observed_at":"2026-08-04T21:20:53.090993Z","submitted_at":"2024-06-30T16:12:37Z","title":"A Comparative Study of Quality Evaluation Methods for Text Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00747","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"A comparative study of quality evaluation methods for text summarization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2407.00747","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:711968fb13bc0cd62ef69498d7ae54f0e73c01321b23d0b1c04ffcde0c5c540b","observation_id":"6537162a-083f-4e8b-8cf3-93cee8c186db","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Summeval: Re-evaluating summarization evaluation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:3aca887d025d78b5dd2fa00b621a0ed455e57fc4637e6ddcc84edd6541cc02d3","observation_id":"ed5f9441-2ec7-436e-b905-7dff63a249fd","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Unleashing the killer corpus: experiences in creating the multi-everything ami meeting corpus,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:a488dbb86b8e28b30e25a8157c4b1f703fd8cf4c0bb05ec2a914ee339d2a2b3a","observation_id":"f064eb1b-c133-4a0b-acaa-f5bda8e28628","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2607.10387."}