{"as_of":"2026-08-12T18:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d90c930b6ab45f08dd436250965179f7756c8564525a5f4897e76eee3676bae6","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:05:30.318725Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.13543/citation-record","integrity":"/paper/2412.13543/integrity","json":"/paper/2412.13543/citation-record.json","paper":"/paper/2412.13543"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.978054Z","title":null,"venue":null,"work_id":"983423aa-944b-4e68-a873-8ece96629de6","year":2016},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.098451Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:97e86e9dec1e5d0e60b8f09d9f14dc16536489bfadab50bacd3deaab97cf8b22","observation_id":"621797f1-6c3a-4f8f-860d-dfef50c566f8","resolution":{"observed_at":"2026-08-11T13:05:30.981161Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.968300Z","title":null,"venue":null,"work_id":"3017b76b-a649-425e-9e92-ee084b62968b","year":2005},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.102460Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:d715e4d66e213ca126e33179e63ccd8466eb354947828fa9ffa26474e10c78fe","observation_id":"46a85395-038c-4ba6-843c-8ffbbf226cb8","resolution":{"observed_at":"2026-08-11T13:05:30.972187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.957982Z","title":null,"venue":null,"work_id":"f699e5e7-91bc-4309-9802-d575c2631250","year":2017},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.105913Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:e8de7b959a7eeb4388fdf4cf2b4228d62906909099edce490c3a88884dac1bdd","observation_id":"570dc33f-feb1-477e-982b-9a4280959c1a","resolution":{"observed_at":"2026-08-11T13:05:30.961175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.948212Z","title":null,"venue":null,"work_id":"99b9f9c3-4150-4da4-91fb-4a937fb4a3a9","year":2021},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.109727Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:605d0977c61c1972e32ebfab7aef31b4bd55278c211680d6f73dd9c508c826be","observation_id":"dbadf8c3-7abf-4b43-bd6d-97455a081214","resolution":{"observed_at":"2026-08-11T13:05:30.951753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.937267Z","title":null,"venue":null,"work_id":"8fdf33e5-5f08-4d6e-b60f-10d716c2bdb8","year":2022},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.113082Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:56199b4694914c1ea1d75e1eae85c964575d26d7360f0fc1ebeda840333df81e","observation_id":"842cb8d9-10b4-44b6-af97-dbc750b8e10e","resolution":{"observed_at":"2026-08-11T13:05:30.940841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.928240Z","title":null,"venue":null,"work_id":"1dd6388a-c491-4d31-899e-433e11953575","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.116379Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:6b355e7ac343bf312d907ad105720b3d95f115384cdb656d9c9757962345b65d","observation_id":"8432f73c-73ba-48d2-955a-73451cec0a78","resolution":{"observed_at":"2026-08-11T13:05:30.931518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.918375Z","title":null,"venue":null,"work_id":"fae23ab5-5f62-4a70-aefb-ece1b2734e77","year":2022},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.119822Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:a3fb80e80c5e367326e5f6f90343ccadfc4584a8a7e04b37e0e3c571de2fb8c5","observation_id":"0f906072-7afb-45c4-910c-c4ae634651cc","resolution":{"observed_at":"2026-08-11T13:05:30.921799Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.908883Z","title":null,"venue":null,"work_id":"5554bfe5-d201-4570-8976-8b365ea8d458","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.123061Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:65f12ec93fee774ad8ec70aaece5e0fce928f0a4f46ce2d17f7174e97a716be3","observation_id":"7522df0c-121d-40c1-ae6b-3521aa06d7b3","resolution":{"observed_at":"2026-08-11T13:05:30.912057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.899393Z","title":"F.; Ellis, D","venue":null,"work_id":"e58f57a8-b352-4a27-af79-bc3719b027a2","year":2017},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.126024Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:bc9a2087f2c5b70865139103aa727020fc7e0b5be3971f332e43173faa32cc61","observation_id":"7aadd44e-31d9-4b42-86c3-662695446d4e","resolution":{"observed_at":"2026-08-11T13:05:30.902967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.890281Z","title":null,"venue":null,"work_id":"5f106865-3114-4cc7-82bc-8501917fbc94","year":2020},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.128915Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:2265d95ac8a0ebe0c19f2ed485765965685d223439e17279141602639b4e7ad6","observation_id":"2d030e45-694b-4690-ad3a-e0a2ff197b74","resolution":{"observed_at":"2026-08-11T13:05:30.893635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T13:05:30.131913Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.131913Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:7b69359caff04b08c268739604cdacf346025adfef1618a0786def5901137f54","observation_id":"432e0ef8-a3cf-4b05-bc43-518b6d5f804b","resolution":{"observed_at":"2026-08-11T13:05:30.131913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.880874Z","title":"B.; Moon, J.; Choi, J.; and Kim, S","venue":null,"work_id":"f57a4d20-95b0-4cd4-90a5-1a67bf73e2ae","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.135722Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:d7dc01183a6cdd676bb49f5f7eba841fd28c4096708b7035cd1953caf9a957b1","observation_id":"321967bc-bbd3-40e2-bf3b-7d2e6688494a","resolution":{"observed_at":"2026-08-11T13:05:30.884192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.871996Z","title":"C.; Lo, W.-Y.; et al","venue":null,"work_id":"4d8ceb62-7e70-4572-8a8c-62f2e096b8ed","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.138866Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:dc18a850064dc85b6254d20951f563c7720e021c2eaff3dac39573618509556f","observation_id":"cdcb2e3a-058d-4721-9efa-37a45bfd6ebe","resolution":{"observed_at":"2026-08-11T13:05:30.875021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.141862Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.141862Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:21e3c98a28a9f908baca523a9e6863ca121122fc75ffc944eae1e074eb7c57f1","observation_id":"e5529ead-eb42-4415-af04-a0e14d8da3da","resolution":{"observed_at":"2026-08-11T13:05:30.141862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.856533Z","title":null,"venue":null,"work_id":"35a0d397-aaf6-40f0-bb20-a5b174280524","year":2017},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.144761Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:dc57b57e4bc335dbcc920f6a88b6b861ac429fac8418629c69322d4fa6d67638","observation_id":"7396238c-efd2-43e4-95ce-82a9d11af8c0","resolution":{"observed_at":"2026-08-11T13:05:30.859941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.845696Z","title":"L.; and Bansal, M","venue":null,"work_id":"089e7a1c-a74a-4758-bddc-ca610ee3bf13","year":2021},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.147673Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:46764df10104789f31ec3ddc46e4cd4615edc7fe32ca6dec372bdd8fa59a2b4b","observation_id":"1d0b9755-324d-422f-a8c3-2fb6bd92ce0b","resolution":{"observed_at":"2026-08-11T13:05:30.849962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.835534Z","title":"L.; and Bansal, M","venue":null,"work_id":"bcaa5979-6b3c-49b9-a050-5f62916bbcff","year":2020},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.150332Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:c8f6c4fd2626dab18cb0c7d476837bc5ca008dfa300553102d8c6d84179a7392","observation_id":"7c866395-42a5-4301-9fdb-b64256c49b98","resolution":{"observed_at":"2026-08-11T13:05:30.839166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11994","last_updated":"2023-08-23T08:29:10Z","snapshot_observed_at":"2026-08-10T17:57:24.992537Z","submitted_at":"2023-08-23T08:29:10Z","title":"Progressive Feature Mining and External Knowledge-Assisted Text-Pedestrian Image Retrieval","version":1},"cited_work":{"arxiv_id":"2308.11994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.11994","snapshot_observed_at":"2026-08-11T13:05:30.386080Z","title":"Progressive Feature Mining and External Knowledge-Assisted Text-Pedestrian Image Retrieval","venue":"cs.CV","work_id":"2d089995-e6f0-4f75-80cf-96b66ce4554c","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.153175Z"},"links":{"cited_paper":"/paper/2308.11994","citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:c56ad7c836242ba00aa771ad29db5db9980c8e84b6ea8ca3e2106ce3912116d1","observation_id":"ac6fb3c8-db07-4f54-b4a1-61dad96d1671","resolution":{"observed_at":"2026-08-11T13:05:30.389863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.826228Z","title":null,"venue":null,"work_id":"a75be490-4f68-4907-b960-6de19c2ecce1","year":2020},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.156503Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:9e4015ea39c88f2b040134e1289d5f2066dedaf25b393accc08465e152b9ba96","observation_id":"48415601-61ea-4ca6-a44d-cbbf71e306de","resolution":{"observed_at":"2026-08-11T13:05:30.829660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.815877Z","title":null,"venue":null,"work_id":"42977492-4548-4d3f-a784-860f75b2b7ea","year":2022},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.159731Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:d7bc9c3fa6b4ed979f13e93017c829919414b41b9332ecd5e59815b834edc6c9","observation_id":"8bc981ab-3cdb-48d6-968e-5e77b8612307","resolution":{"observed_at":"2026-08-11T13:05:30.819345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.806700Z","title":null,"venue":null,"work_id":"4f97980a-c481-4d53-8f91-493b59764c08","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.163043Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:b8c28d1cbbb06f2d2adb7dde82ddf5669f1fb755f8611b84d681f760280cc2b8","observation_id":"d9c78f73-157a-4adb-b8a5-f6413d93406e","resolution":{"observed_at":"2026-08-11T13:05:30.810017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.166205Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.166205Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:4d15e52d77d6007cad93f47aace43996f3ab28d70b47dd5189d2ec84f55c5147","observation_id":"a12a47b7-7efd-42d3-a236-159d792ae7bd","resolution":{"observed_at":"2026-08-11T13:05:30.166205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.792221Z","title":null,"venue":null,"work_id":"eb8b946e-234c-4729-8d56-a9b343001e06","year":2022},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.169272Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:dccb512da5f167b752f32733222e3ea9d69aab1de1fe542ddb5a46d9b9599e0c","observation_id":"7224c271-c10f-4bc5-b11d-2028699f89d8","resolution":{"observed_at":"2026-08-11T13:05:30.795369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.782291Z","title":null,"venue":null,"work_id":"5a19758d-1f75-4ed6-8659-ac934fd09ed7","year":2022},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.172330Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:bd55dc7edf7d318f4be0e6dc6acb25e1e9603e7a1a7789a755acac93f7e5ea1d","observation_id":"179b9a92-a563-4919-a0b8-2e9eedb94028","resolution":{"observed_at":"2026-08-11T13:05:30.786073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.773103Z","title":null,"venue":null,"work_id":"93a8c715-73c6-4f45-89ee-bda005fde6ab","year":2022},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.175565Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:a9cc98826e52232236b50ef0e8a2e5b4ada712a801700d3b632d8da0198caa57","observation_id":"507c45e5-ba7b-4bd0-a8b8-802d1a0f632e","resolution":{"observed_at":"2026-08-11T13:05:30.776162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.762962Z","title":null,"venue":null,"work_id":"4cd0b71c-0b5f-49a1-b95a-0397d172ceb5","year":2018},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.178523Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:0970794da0dffb331139c74076f91b8585d2ba0184efe453bc681aed8a9dbbd6","observation_id":"d0c42b9a-eab6-4f20-8e35-2980c6a0711d","resolution":{"observed_at":"2026-08-11T13:05:30.766160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.753016Z","title":null,"venue":null,"work_id":"4ad5fce9-1c86-4a84-a4bb-32f98ffb293c","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.181447Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:f8c7042d658502ee20b95dded8df802c1ab8de30573377c9260a031563925692","observation_id":"4db48883-a127-4233-a809-1c978a722af3","resolution":{"observed_at":"2026-08-11T13:05:30.756559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.742722Z","title":null,"venue":null,"work_id":"92187da3-ce32-4999-8ab0-7d651c815bb5","year":2022},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.184540Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:23eb2d6a955e0ad85c5f956366d354b5cbef3ccff8513fead70504687ce415c8","observation_id":"de6b28d9-7cfb-43d6-85f5-77d6c2694d36","resolution":{"observed_at":"2026-08-11T13:05:30.746349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-11T13:05:30.187748Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.187748Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:245ccfecf31ab00b932acaa6a2ca97e851e04aab349376415dade4ceeff7f6d5","observation_id":"ba993c6d-6178-4537-9aed-8b06b7d0de6d","resolution":{"observed_at":"2026-08-11T13:05:30.187748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.733183Z","title":"a ckstr \\","venue":null,"work_id":"3d9d99bf-4b8d-46f6-bf5c-59dcc8a630d0","year":2016},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.191315Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:366d732a2000c2a447065811855fbf9ea419bbb7535f5e5e76d5f91cc44f8883","observation_id":"d9243104-2090-4650-840c-1f2d8d66d667","resolution":{"observed_at":"2026-08-11T13:05:30.736571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.194852Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.194852Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:db3f501f395ec93193f48f14ae00f7fe58308ef7aa535b6300a6cfc3b3591e47","observation_id":"b09caa4e-eb33-4e69-a43c-2dfae1c041c3","resolution":{"observed_at":"2026-08-11T13:05:30.194852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.716777Z","title":"E.; Neumann, M.; Iyyer, M.; Gardner, M.; Clark, C.; Lee, K.; and Zettlemoyer, L","venue":null,"work_id":"a29ee3c0-7171-4887-97b4-08c26cc92235","year":2018},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.197899Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:6dcacef3f924d1a9a7302f34d82a2dd97486f342517b4cded91499d7081376c9","observation_id":"85c48127-17b2-498f-b98d-1847bc1448a1","resolution":{"observed_at":"2026-08-11T13:05:30.721073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.200832Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.200832Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:48e7867f37056e113642591c7883be262ee45259a948ca2461a63195d09b61eb","observation_id":"11d9d22a-125e-44fc-b601-c017077bc0ba","resolution":{"observed_at":"2026-08-11T13:05:30.200832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.702662Z","title":"W.; Xu, T.; Brockman, G.; McLeavey, C.; and Sutskever, I","venue":null,"work_id":"076370f6-f86d-47bf-9934-b7a11b4ee290","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.203934Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:753d91715e46ad473310ac67f4001332d6249ea91facb9b80acf13ea2c1568fd","observation_id":"1f43b72f-16b2-4d4f-8d1c-aae02b5491b7","resolution":{"observed_at":"2026-08-11T13:05:30.705846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.693388Z","title":null,"venue":null,"work_id":"8e8c6eea-2664-4b20-837b-bf04e7b5dd05","year":2019},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.207314Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:946b5518213f430bde79cce64f298ba914f35a5c9e1df39f20e0b7a8531d3103","observation_id":"317c6264-0d7f-474e-8de5-b3009be886c2","resolution":{"observed_at":"2026-08-11T13:05:30.697089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.684623Z","title":null,"venue":null,"work_id":"0bd37c51-ba09-4b0f-8bb9-31792c9bc65c","year":2016},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.210609Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:0f69f5b44760444cfc0ef1831dde3ff95ffda8573f54dad3e7a4b4614866018a","observation_id":"2c4eed74-6460-4a35-9eaf-25db5747b1d6","resolution":{"observed_at":"2026-08-11T13:05:30.687783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.675552Z","title":"S.; and Gong, B","venue":null,"work_id":"71eb38c6-28d1-40ef-8ac1-adfa8f2b5ac2","year":2017},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.213667Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:535564bbd4fa6a36bbb74f074b7a1514041cd1ed85b1210fe8161da56ff4457c","observation_id":"24b8bfac-d9ce-42ce-9150-e8ca00d4d1ca","resolution":{"observed_at":"2026-08-11T13:05:30.679070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.666524Z","title":null,"venue":null,"work_id":"470e71e1-c9a1-440c-b3a8-015ffcf4fb4b","year":2015},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.216740Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:b119dcad9f8f358ed726c90e9ce2d4b07a8a41e08330c6b8e6d48f7d599831b4","observation_id":"efc55409-d1b6-4841-a8bb-34fc11f1be4e","resolution":{"observed_at":"2026-08-11T13:05:30.669610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.657543Z","title":null,"venue":null,"work_id":"979df450-bc00-4116-b2bc-4f35e13e5b13","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.219711Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:26a89697f1c460e4c0e6a2937771c20bad23deea7b6128d4b21b4884d2d91a34","observation_id":"d0d13d00-66c7-4f14-afb4-98112d5af44d","resolution":{"observed_at":"2026-08-11T13:05:30.660839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.648377Z","title":null,"venue":null,"work_id":"3dfe8f9c-23a5-408d-8fee-23f5afe1e0a8","year":2022},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.222672Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:69954de9bfdfdc227864a334c8086a8425a5e9f1ad40052bf6c27c7a5f9cd7f7","observation_id":"1a8bfeb7-dd86-4962-820a-1ff754fa62d4","resolution":{"observed_at":"2026-08-11T13:05:30.651585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.639629Z","title":null,"venue":null,"work_id":"e8440e67-d536-438a-89c2-bcdff678fec1","year":2011},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.225646Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:df88345a1272808f6c778dde89c313af5f3c0f12a7f0e29a1af22a34cfe1be02","observation_id":"70af3304-33c7-482d-8ae5-b6321f01c5e5","resolution":{"observed_at":"2026-08-11T13:05:30.642684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.629507Z","title":null,"venue":null,"work_id":"0d042ee8-b403-48d4-bd4c-9245b2eb41e1","year":2021},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.228749Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:44bccf983df3242e61ef1f0e6fe6b11ade307595e1e2cd19e9cd2b4d9de9b372","observation_id":"13f327e9-56a7-4fd4-9ffb-19d013766b01","resolution":{"observed_at":"2026-08-11T13:05:30.633664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.620679Z","title":null,"venue":null,"work_id":"63d16320-d9d6-4311-b217-b5a90c2d542c","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.231795Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:943967d04e416f06ff0d48da22bec92f5a09953b30e6e594f85cb981434e34c1","observation_id":"cc51fef9-1693-4960-b48d-8860aa2019e8","resolution":{"observed_at":"2026-08-11T13:05:30.623925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.611709Z","title":null,"venue":null,"work_id":"52bcf5a9-0b41-4d76-a5bc-eba50af9810c","year":2022},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.235073Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:b49b379b468131f288e250a6989141b52a7330f93c282592575289d3cf87026a","observation_id":"453c791e-3257-4725-a86e-cd0983447a08","resolution":{"observed_at":"2026-08-11T13:05:30.614968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.602322Z","title":null,"venue":null,"work_id":"d808fa27-53e8-411f-baee-5bc240c7965c","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.238018Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:b77ac71ccd564e36a4ffea7aa19dfbd598c4490a55708362c3cbff0028cc20c5","observation_id":"84639bf0-59dc-4504-a8b8-84534fab5558","resolution":{"observed_at":"2026-08-11T13:05:30.605826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.593064Z","title":null,"venue":null,"work_id":"847d2a9a-2ef8-40c6-bbd3-6dafdc782693","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.241098Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:636a99790b7dd5cbf45bdf2c19e9e87157de7e78a2c6c520376aa08b60c1956d","observation_id":"da6a7dcf-ef1f-416f-b9b5-1273ee82172b","resolution":{"observed_at":"2026-08-11T13:05:30.596246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.582904Z","title":null,"venue":null,"work_id":"df50cb07-b41a-4cd6-a457-f2b78833d446","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.244117Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:23765568d1fbe03f660efc743e32add715a82f3fd2faf3497c2fe613e4c74ecc","observation_id":"afc69608-36e0-4da0-9d60-2ab2dcf2e100","resolution":{"observed_at":"2026-08-11T13:05:30.586905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.573717Z","title":null,"venue":null,"work_id":"b55aceaa-dc73-44c4-a549-fdb8c183426e","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.247158Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:5e3f213b381ae38319d432fe4c616cc2657d8e6ddc8dafc5e3a7ca75cb6de4ff","observation_id":"c9121db9-9e08-42d6-8692-6505a0ed1b7e","resolution":{"observed_at":"2026-08-11T13:05:30.576808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.565112Z","title":null,"venue":null,"work_id":"cc7334c8-6793-4013-9158-80d7f0739435","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.250144Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:1cc6eb2d0b079660143dd3ebcf83654b5ad8de53bb1150f33c30a70ac59c1ee4","observation_id":"f8dbdd3c-08b0-4938-b86f-e5b045e0244b","resolution":{"observed_at":"2026-08-11T13:05:30.568166Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.555318Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":"ba5080f9-fa9f-4129-8cf1-9a9c541965ea","year":2017},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.253170Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:41185643d2e7a2b52c2d53bd160185d882ccca872b3ced746a33228ef35e7fa7","observation_id":"558ab4ca-667c-49f9-85ac-bc9dbc030ca3","resolution":{"observed_at":"2026-08-11T13:05:30.559025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.256242Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.256242Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:cab51a47004631e007b8aec5e5353b733d79dc169f1cbab86bf775f6e69b844e","observation_id":"93e2ec46-2b47-41e0-8cd0-d13736eef4e9","resolution":{"observed_at":"2026-08-11T13:05:30.256242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.540680Z","title":null,"venue":null,"work_id":"d43eda74-c8eb-487e-b9e7-05623d405905","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.259446Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:1b3f43efa7f420d3c856a0a3e3e13828748cd9b317cc5d95db0c51b802292e7d","observation_id":"17ccf0fc-06f1-4aa7-a669-eecfa0cbb0ea","resolution":{"observed_at":"2026-08-11T13:05:30.543656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.532354Z","title":null,"venue":null,"work_id":"679b20fd-f749-4c3d-ac3b-22243d55fc5b","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.262374Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:1a5f9183846fd0de66e01f9e6e9f9992d13d19b39abd4877f273639cb149d10b","observation_id":"80e057c9-42d4-4b7d-80a1-68ecc389297f","resolution":{"observed_at":"2026-08-11T13:05:30.535610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17481","last_updated":"2024-11-26T14:46:42Z","snapshot_observed_at":"2026-08-12T12:02:23.249076Z","submitted_at":"2024-11-26T14:46:42Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","version":1},"cited_work":{"arxiv_id":"2411.17481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17481","snapshot_observed_at":"2026-08-11T13:05:30.363755Z","title":"Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding","venue":"cs.CV","work_id":"bd678cb5-fc91-46dc-b566-f1bb459dc724","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.265355Z"},"links":{"cited_paper":"/paper/2411.17481","citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:e9b9de0a07c3f41f1a54033a56d5e86bcd9f0062e772ac81ecbc42e2838a9f31","observation_id":"d1da524e-6e8d-46e2-9bc4-167b63b1c201","resolution":{"observed_at":"2026-08-11T13:05:30.367482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.524068Z","title":null,"venue":null,"work_id":"d6dfeae9-6378-40fb-9d43-b03c37107087","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.268775Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:206e130ae65222fbb0163efe6b52fd8024461249875b3debbfeaedbe44040d15","observation_id":"a8962afa-2aa9-440b-93cd-72f757818b48","resolution":{"observed_at":"2026-08-11T13:05:30.527032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.515364Z","title":null,"venue":null,"work_id":"a7674a40-4594-440d-8d94-eb42e4d70045","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.271964Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:46cedc1d5f6418cbd6ae1c26945f9090bf1e85c50caf9efe22dc4ff707447fee","observation_id":"203aae18-a585-4471-a73e-4280fa3e4e43","resolution":{"observed_at":"2026-08-11T13:05:30.518557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23570","last_updated":"2024-10-31T02:25:47Z","snapshot_observed_at":"2026-07-06T19:42:38.715005Z","submitted_at":"2024-10-31T02:25:47Z","title":"Phrase Decoupling Cross-Modal Hierarchical Matching and Progressive Position Correction for Visual Grounding","version":1},"cited_work":{"arxiv_id":"2410.23570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23570","snapshot_observed_at":"2026-08-11T13:05:30.348336Z","title":"Phrase Decoupling Cross-Modal Hierarchical Matching and Progressive Position Correction for Visual Grounding","venue":"cs.CV","work_id":"d88c1089-0b4e-4583-b3b8-f8d23ef08fbe","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.274961Z"},"links":{"cited_paper":"/paper/2410.23570","citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:7908eb7bf0312889f60c97f337241bcdbcb27eedb4d628f5cf8c440ec277f819","observation_id":"da782162-49c1-4ed9-8170-6f69ceac2984","resolution":{"observed_at":"2026-08-11T13:05:30.354127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.506577Z","title":null,"venue":null,"work_id":"0a4d55a9-281e-4fe1-96fe-f09d945b527b","year":2014},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.278350Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:dc2cb13a84f9f6798f63d5383f3f7b857a56a8d3111560401033724ee389c344","observation_id":"6f1f3dbd-f444-4f05-8397-c8d2ce1cb1dd","resolution":{"observed_at":"2026-08-11T13:05:30.509619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.497612Z","title":"H.; Miech, A.; Pont-Tuset, J.; Laptev, I.; Sivic, J.; and Schmid, C","venue":null,"work_id":"70818340-05fd-42cf-abc6-db68e8cdcf94","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.281379Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:b8ff59f4a068a57531976f24bbf0d1ecd1c302ecb10933be0528ad77499ed008","observation_id":"1746452d-af49-46d6-b04d-ba1990c53b7a","resolution":{"observed_at":"2026-08-11T13:05:30.501011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.488977Z","title":null,"venue":null,"work_id":"f910eaf0-de69-4618-9028-82ff9d503eec","year":2021},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.285621Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:462dcdaf23cc0bae184ad8e1409c8836599bff4068857719e3def5a8833aaef1","observation_id":"09eebf43-4360-44b5-87a8-c0c41fd14d47","resolution":{"observed_at":"2026-08-11T13:05:30.492088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.479907Z","title":null,"venue":null,"work_id":"afc49a0e-226e-412e-a460-aa96c05b63b4","year":2021},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.289227Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:37ee5c5279da368b89fed32cd1a8a02575f8e58daa9c0d7f23642613fd2827d0","observation_id":"8173df16-b73d-4ce2-888b-374a9112814f","resolution":{"observed_at":"2026-08-11T13:05:30.482993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.469817Z","title":null,"venue":null,"work_id":"452c90ff-41c0-4994-98e7-c52c3b937f8b","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.292482Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:ead3c942ad5b4aab4754676f101ecf514f898e649863b96f56492f778ea08487","observation_id":"2af6b1c6-f29f-4868-99f2-d20a0ccbea05","resolution":{"observed_at":"2026-08-11T13:05:30.473921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.460438Z","title":null,"venue":null,"work_id":"317309d6-fef7-4185-80ca-c1cb0b1d1733","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.295720Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:10ec69af397004644597e9f8f3849f1f90db0c7d4a5b316856da37edbc873570","observation_id":"c00ab8c4-7ec8-4a0f-83b9-3e2119c2b5e6","resolution":{"observed_at":"2026-08-11T13:05:30.463972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.451214Z","title":null,"venue":null,"work_id":"c274e501-b5fd-4c75-9fce-ea200b357a60","year":2023},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.299041Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:c22bf841ee82e42dce26b93c2874e66d07502e0aa2fffb3d4f2667f8853f55a2","observation_id":"f556a9cb-25c8-456a-b01e-92b96160dd08","resolution":{"observed_at":"2026-08-11T13:05:30.454283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.442615Z","title":null,"venue":null,"work_id":"95af18b2-8f93-4557-ab8a-9cf82cf694cd","year":2019},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.302218Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:b20feea33d62b246b4cda91bb0ffdb87c64b46092d6fb70fa603a43aa85691e5","observation_id":"c5b4cb8f-840d-4c6f-a5b4-35794465efc8","resolution":{"observed_at":"2026-08-11T13:05:30.445543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.433699Z","title":null,"venue":null,"work_id":"d3da99c0-bc1b-453d-a6a8-4bf3ff880e1c","year":2024},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.305257Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:388d2f5009fa3b268f8d85c3afcecea3e471212837ee20305634950eae61799d","observation_id":"399f3877-72aa-4a48-ad97-e56dabdde0ee","resolution":{"observed_at":"2026-08-11T13:05:30.436792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.424310Z","title":null,"venue":null,"work_id":"0a734798-6738-4e55-a6f7-54cf08f2f6c0","year":2020},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.308405Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:e3886b1c2a68f7de01c7623693fe684bb5214302779c2b53e4fbdead91883c46","observation_id":"a0b036bc-c213-4e29-878a-b06cc2297a2b","resolution":{"observed_at":"2026-08-11T13:05:30.427753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.414896Z","title":null,"venue":null,"work_id":"a2f68773-c50d-44ab-8157-47d7bc2285d1","year":2018},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.311665Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:079f7dfe0bc3c923491650ab43bb225d705322305684990d827acdb1b5ccea32","observation_id":"7aeaa1e0-1375-4a13-80f6-4b957f735140","resolution":{"observed_at":"2026-08-11T13:05:30.418347Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.315148Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.315148Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:dd0956c160bd77443fcd334e2509fa4b578cdd7f2531b7a2905b5d0152b55b30","observation_id":"27983f8e-47bc-4615-b94a-e6f29b3719f9","resolution":{"observed_at":"2026-08-11T13:05:30.315148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:05:30.318725Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T13:05:30.318725Z"},"links":{"citing_paper":"/paper/2412.13543"},"observation_digest":"sha256:b9fcc799bc89d83d4390e938703c0e12761f02b22796aacf3c8e8f637cf78221","observation_id":"7f2dcf3e-49ac-4e2c-85d1-699328a7c696","resolution":{"observed_at":"2026-08-11T13:05:30.318725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.13543","last_updated":"2024-12-18T06:43:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:37:47.231867Z","submitted_at":"2024-12-18T06:43:06Z","title":"Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":3,"verified_fuzzy":11},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2412.13543."}