{"as_of":"2026-08-23T14:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1ca71d9d9824887877c6ebcdaae7099e4852f7b108d25b2c4794f264c71b195","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:59:44.490450Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11326/citation-record","integrity":"/paper/2505.11326/integrity","json":"/paper/2505.11326/citation-record.json","paper":"/paper/2505.11326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.303049Z","title":"Whisperx: Time-accurate speech transcription of long-form audio","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.303049Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:8e0f772a001aa1d94746460d98d5f16c0408d718b87be582c0a0671f1cf0a1b2","observation_id":"75cc6bdf-361b-4106-9598-db20beabe6fb","resolution":{"observed_at":"2026-08-15T20:59:44.303049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00738","last_updated":"2023-11-01T15:13:49Z","snapshot_observed_at":"2026-08-20T12:42:56.732712Z","submitted_at":"2023-11-01T15:13:49Z","title":"Can Foundation Models Watch, Talk and Guide You Step by Step to Make a Cake?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00738","snapshot_observed_at":"2026-08-15T20:59:44.308563Z","title":"Can foundation models watch, talk and guide you step by step to make a cake? arXiv preprint arXiv:2311.00738, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.308563Z"},"links":{"cited_paper":"/paper/2311.00738","citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:e3e8ca44846d02ac56d6cb7c88162016583a37244c2e8cd53562f2678696ae44","observation_id":"b1f03ec7-e3b7-4e61-8478-188164d96183","resolution":{"observed_at":"2026-08-15T20:59:44.308563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:45.156473Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":"82a1c8d3-fd12-4445-ae5c-a3725df291ac","year":2011},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.315951Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:01563b4badc7d5e2b4a5cc0bc99c31601669401ade3399bbc3c1ccd164f14b3d","observation_id":"2f98d959-d7c1-407e-8ec2-e042c4a3f884","resolution":{"observed_at":"2026-08-15T20:59:45.161929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.321146Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.321146Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:f0d057f12d56c51f5648fc4412609dbcb905ad7801c1fcf6ec8840fdbffebb68","observation_id":"ec80b8eb-3278-4975-bb24-63c30c98d033","resolution":{"observed_at":"2026-08-15T20:59:44.321146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:45.129886Z","title":"Scaling up soccernet with multi-view spatial localization and re-identification","venue":null,"work_id":"3cbb14c2-4f6a-4557-a995-ce0da6245bba","year":2022},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.328136Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:50a2891fc066cc313f17756e0b43f3d4de3f2e4939ea19259dee1f213e0f57c5","observation_id":"21cf206b-517a-4e58-9020-752a3809d13f","resolution":{"observed_at":"2026-08-15T20:59:45.135652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:45.111466Z","title":"Soccernet-v2: A dataset and benchmarks for holistic understanding of broadcast soccer videos","venue":null,"work_id":"702970d4-f6d7-42c9-9e32-0cd270693430","year":2021},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.333812Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:a42abf7f636b6c534b031d16a6127c026ae7c77c1b7054fa30829320c57d2373","observation_id":"fe29c422-2803-4947-9b12-29889e1c19d5","resolution":{"observed_at":"2026-08-15T20:59:45.117010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-15T20:59:44.340813Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.340813Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:2183de068b27e3ab08a52810a54f60ac4f3f7664fe636c03c3da368999a8b069","observation_id":"7232378e-932c-4555-aab4-93690da115c0","resolution":{"observed_at":"2026-08-15T20:59:44.340813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.347079Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.347079Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:58621d2c3865ef04917719ab9bc28eb0d4377b47182486b2dedbbd2d15813783","observation_id":"b6849114-f0f8-4624-ba96-25c03349e43d","resolution":{"observed_at":"2026-08-15T20:59:44.347079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.351745Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.351745Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:c566663cce971dfe3826682c3924736c7a43b9e8a877b0af042f0c48ad5394bc","observation_id":"1ab8fa84-8620-4326-a328-c5bc05163bfa","resolution":{"observed_at":"2026-08-15T20:59:44.351745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-20T22:03:51.775198Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-15T20:59:44.356501Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.356501Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:e36e9e36544ab6811daa48eb75ef537c06b2b7bb1f3eeb1fca7dd5aa9fbe675f","observation_id":"8dc99ae8-e853-4700-ba2d-df6efd0f2259","resolution":{"observed_at":"2026-08-15T20:59:44.356501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.362667Z","title":"Kuehne, H","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.362667Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:a9d5c5cd99f52392f7e67b1d6efe61ddae23401dc7c79e0668ef115098fd2cac","observation_id":"1c910d08-713e-4632-b3a9-38aacb82405e","resolution":{"observed_at":"2026-08-15T20:59:44.362667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:45.061699Z","title":"Revealing single frame bias for video-and-language learning","venue":null,"work_id":"3ef69865-2944-4f91-9bcd-128d202801b9","year":2023},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.367653Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:6b4be89c87959011442a03b244b8bb1e172b5588752507eaa9c7fbe1059cc357","observation_id":"61f983df-8579-40c0-badd-30d8c695e420","resolution":{"observed_at":"2026-08-15T20:59:45.067562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-08-20T14:00:31.960419Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-08-15T20:59:44.373465Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.373465Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:a58870df0d6926a4ecd18656429343f02d502bde0f6155d778074c9c6fd1bfe9","observation_id":"d7a362db-5f54-4548-b73e-99ceb56abe63","resolution":{"observed_at":"2026-08-15T20:59:44.373465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:45.043752Z","title":"Video-ChatGPT: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"deeb17ac-b84f-4ad4-8dc3-3c92fb858da0","year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.378910Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:3fb4a9e6f9b5b097921d29c5da4d7309097822e1c77d2aff04adc59784704f51","observation_id":"f7a941e4-affd-461e-ba72-7bc96ba969f5","resolution":{"observed_at":"2026-08-15T20:59:45.050166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.383853Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.383853Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:0691e81ec5026c3921fe1382d3f35269e628ff3c356215fbb2e2a3bd3126cde8","observation_id":"c723c2a4-4c43-482c-9f4b-a56295a245a5","resolution":{"observed_at":"2026-08-15T20:59:44.383853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.389000Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.389000Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:e6935da88a7bc6b899b88dc0e54c3154bd4f1898d386bf224bf2ca3afd6a0638","observation_id":"d797e867-3737-451a-b6b2-bfb6ac20aec2","resolution":{"observed_at":"2026-08-15T20:59:44.389000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:45.000879Z","title":"Ego4d goal-step: Toward hierarchical understanding of procedural activities","venue":null,"work_id":"feba3f9e-d014-4c2c-90eb-343dbd3803bc","year":2023},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.393797Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:905110b868eea0996f859439cf1dc78db2e063e2adb47154ce9b07598ea7f89a","observation_id":"8b4620d1-88e6-470b-95ea-b89dcbff0d32","resolution":{"observed_at":"2026-08-15T20:59:45.007211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-15T20:59:44.398445Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.398445Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:8ebf8f985f11abe744820d6e59481f9fba35ec6d1773bbd54ed9eaafc39dc530","observation_id":"26f36893-dc16-4247-8980-214f94fc6d29","resolution":{"observed_at":"2026-08-15T20:59:44.398445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-15T20:59:44.403939Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.403939Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:19f732ead777ac0a577dc412dba39af3ace8c9c7233c8dea9fd9bc45a25c6f44","observation_id":"ff7c91f7-c8bc-4515-9515-da0647bdb275","resolution":{"observed_at":"2026-08-15T20:59:44.403939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.408719Z","title":"Holoassist: an egocentric human interaction dataset for interactive ai assistants in the real world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.408719Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:38fb159ea058998531fd6ceb3ad34a2a6d97ae98d94a5087902fb10fd07d0f6c","observation_id":"2fbeb405-5b44-461d-a139-de0c6372cb3e","resolution":{"observed_at":"2026-08-15T20:59:44.408719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13468","last_updated":"2025-01-23T08:33:10Z","snapshot_observed_at":"2026-08-17T02:49:36.622314Z","submitted_at":"2025-01-23T08:33:10Z","title":"Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13468","snapshot_observed_at":"2026-08-15T20:59:44.414305Z","title":"Streaming video understanding and multi-round interaction with memory-enhanced knowl- edge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.414305Z"},"links":{"cited_paper":"/paper/2501.13468","citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:d226118f9c4ee9010a06c8e2a69d68593938fb7c4e2a79eee1d3b628094dd967","observation_id":"563f63b5-921f-4b96-827e-5d52e4954507","resolution":{"observed_at":"2026-08-15T20:59:44.414305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.972750Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"13f064cf-0765-449b-808c-b059ec463b73","year":2017},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.419466Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:798484610ee6c7408d0984139df5f968f13159652c824cce76fe603a43f2c6ac","observation_id":"78c0ae33-b22c-4b93-ac37-f72554f67797","resolution":{"observed_at":"2026-08-15T20:59:44.979142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.954568Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"bb6ec961-3979-4903-85b0-5084727cc79f","year":2016},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.424084Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:a147fdf3cf37be0379224f2f34425dcaff0e708fe7a99fa3e6fc5822a97a6bcc","observation_id":"4aae3c04-e1d7-4d26-8935-6e9bb160baa2","resolution":{"observed_at":"2026-08-15T20:59:44.960293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.429413Z","title":"Svbench: A benchmark with temporal multi-turn dialogues for streaming video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.429413Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:72da2fdbce003943852a6dab0ab3651918e86650738fd33c27000ec469bb08f4","observation_id":"6854d76f-e17e-4701-949b-73fa9386dad4","resolution":{"observed_at":"2026-08-15T20:59:44.429413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.937702Z","title":"Eliciting in-context learning in vision-language models for videos through curated data distributional properties","venue":null,"work_id":"4694a222-23f1-41b6-a60d-78538298f27e","year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.434797Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:dbcc65e6881e658b0c6b87aa14f333f632b73bc886178b743e7c48c55f002abf","observation_id":"4187126b-7494-40be-bdfb-29e760759ba6","resolution":{"observed_at":"2026-08-15T20:59:44.943839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.917531Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"6f38a134-b9f0-4baa-9d4b-6bfc88ca20fe","year":2019},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.439748Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:f006de05f81865d2430be7686815606824501d8447623a0a01500baed6da4617","observation_id":"d8794ff5-f4a5-4c5e-a1fd-1b8f530ed218","resolution":{"observed_at":"2026-08-15T20:59:44.924842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-20T14:00:35.248214Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-15T20:59:44.444257Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.444257Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:da4c0defdbaad6c149492795357d205f5ce86ab8b9f899be1b300daac1de727a","observation_id":"72b39727-9394-4d29-a9f6-046ca197b88b","resolution":{"observed_at":"2026-08-15T20:59:44.444257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-15T20:59:44.449130Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.449130Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:204aaad5270ea47fcdec17f28f77963ada0191567d126880861e9f0e45c7fa29","observation_id":"24d01f6e-a1e8-46ca-b135-c1b904cdd358","resolution":{"observed_at":"2026-08-15T20:59:44.449130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.900875Z","title":"Streaming dense video captioning","venue":null,"work_id":"944f6d00-3cea-44fd-9212-473a369ea1fc","year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.455082Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:b51da0eb3b90b9ca0c7537c6a0544b63de74be60ecad1c29e31839a4a18f69c9","observation_id":"ccfdbc82-a9f5-4d8c-a563-a0de92771cbb","resolution":{"observed_at":"2026-08-15T20:59:44.906573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.884084Z","title":"Streaming dense video captioning","venue":null,"work_id":"de750f63-cce5-4c2a-9870-3dc55dbca791","year":2024},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.460725Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:0b77021a25bf7242ced80a2bfc4ac22a117120c9c31ec67d390e868ca53297ed","observation_id":"819f5db5-769b-4bb4-b26e-1449ad8caa05","resolution":{"observed_at":"2026-08-15T20:59:44.889502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.865451Z","title":"Assistant: Now remove the indicated component that’s damaged,","venue":null,"work_id":"fc8e12f6-605f-4826-86fd-bc7fb0e59564","year":null},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.466891Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:84e561d57e3d332b6c1ae6aec2f7ab6a5c970e5e80a97902775e2bc21b802137","observation_id":"f3643ec8-d4c5-4917-bc67-5acdd74abe71","resolution":{"observed_at":"2026-08-15T20:59:44.871347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.848770Z","title":"User: Oh, this thing?","venue":null,"work_id":"31e27b99-5d97-4227-8e43-c362ffcdaa60","year":null},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.473863Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:3cfdb7d1ad32d86d73e4449aae461cf12d92575992a2be86a478e564a79e0486","observation_id":"2cfa6a8a-4c17-49a7-aa41-814f6dd7ccb3","resolution":{"observed_at":"2026-08-15T20:59:44.855193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.830499Z","title":"Assistant: To the right","venue":null,"work_id":"7f8db3ff-0d7b-4ba4-b9e6-8d98d852680e","year":null},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.479794Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:452237d12ba33c1395c355fc60ab20e0e33b3a76a9c4486b0ffc7cd7b99950a9","observation_id":"54a7b08f-9c91-48d5-b906-b79e2f593a37","resolution":{"observed_at":"2026-08-15T20:59:44.836564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.811835Z","title":"Assistant: The small cube","venue":null,"work_id":"38e69671-37de-41fd-a5ac-ec57757bbd77","year":null},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.485009Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:8dc878de1afb4f4384f5b272b1c81eb0c6fb3396eb9dea979d80da0904ffb4c1","observation_id":"d68f24af-eb19-486d-80b3-4a095169399a","resolution":{"observed_at":"2026-08-15T20:59:44.818262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:44.793581Z","title":"Assistant: Yes","venue":null,"work_id":"c5ee53a0-4ad1-4743-b7cf-3141d239f008","year":2015},"citing_paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:44.490450Z"},"links":{"citing_paper":"/paper/2505.11326"},"observation_digest":"sha256:59c9f44bf3f1bcdfee247d7c83f093d04c2900c1503883416cb505778b4ac460","observation_id":"257df93b-1121-4904-89de-6ab1c86d47d6","resolution":{"observed_at":"2026-08-15T20:59:44.799748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11326","last_updated":"2025-05-16T14:48:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T14:00:50.097053Z","submitted_at":"2025-05-16T14:48:30Z","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2505.11326."}