{"as_of":"2026-08-14T09:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:302a9282452cf6e18687b3d851467de453b74c389b6e61585e1d0feaf1ba5b7e","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:19:36.314950Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.03567/citation-record","integrity":"/paper/2412.03567/integrity","json":"/paper/2412.03567/citation-record.json","paper":"/paper/2412.03567"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.670402Z","title":"Behavior: Benchmark for everyday household activities in virtual, interactive, and ecological environments","venue":null,"work_id":"18daa6c7-d2fc-45e4-9f4e-31a9a524a36e","year":2021},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.866379Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:d95c2657291d59be6e1ed39db5ac90c7d9deb7c5fc8e4c687a55d874dbb4e268","observation_id":"9243e9c8-1b58-46fe-80d7-dd6708604434","resolution":{"observed_at":"2026-08-11T22:19:37.675841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:35.872137Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.872137Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:5bae8492de7ec0467c087e6f3d622f5f9917a5611e756eb58908001426b78a04","observation_id":"a824b367-a688-4d4c-a2a6-214c26b9947c","resolution":{"observed_at":"2026-08-11T22:19:35.872137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.638017Z","title":null,"venue":null,"work_id":"0031639b-5b6b-4629-99fc-2a6ffa8fd3f6","year":2022},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.877177Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:b6891158372e2b3ef4e9e87b93b72947fc461461ea7c12d9e00b023ea931c196","observation_id":"c6b82df4-9489-4693-bc2e-4dafd81a06a8","resolution":{"observed_at":"2026-08-11T22:19:37.643152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:35.882828Z","title":"Learning spa- tiotemporal features with 3d convolutional networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.882828Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:87937f8038af8aab58ee5fe561e1cf8f1b45bf9b6f942b5a093daeefb0668b67","observation_id":"60d9baac-08dc-409e-8f75-cf67b70e073b","resolution":{"observed_at":"2026-08-11T22:19:35.882828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:35.888394Z","title":"A closer look at spatiotemporal convolutions for action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.888394Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:160e97122ec51097072c68e4b080dcd2750cc766233d222a3a59a36fe9ee6820","observation_id":"b8f5a740-db7c-4cce-807f-d6f0b3a04b34","resolution":{"observed_at":"2026-08-11T22:19:35.888394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:35.893660Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.893660Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:380f2dc1fc5602eb994c652904c8043bdc8e54aee0f6627ddcd9bfdc7afd0f05","observation_id":"7b7a73ae-f622-431a-9dfc-94430811dfe9","resolution":{"observed_at":"2026-08-11T22:19:35.893660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.04818","last_updated":"2017-07-16T04:23:57Z","snapshot_observed_at":"2026-08-06T21:39:58.286842Z","submitted_at":"2017-07-16T04:23:57Z","title":"RED: Reinforced Encoder-Decoder Networks for Action Anticipation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.04818","snapshot_observed_at":"2026-08-11T22:19:35.900225Z","title":"Red: Reinforced encoder-decoder networks for action anticipation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.900225Z"},"links":{"cited_paper":"/paper/1707.04818","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:4cddb604ffc859fe337a80f33590906cadd24ca7cb1a75f1f637ed838fe9b0a8","observation_id":"13adfd30-4de2-4585-8006-a71d8d697503","resolution":{"observed_at":"2026-08-11T22:19:35.900225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.590805Z","title":"Temporal action detection with structured segment networks","venue":null,"work_id":"1af43eaa-14e1-457d-8195-9731b8b74e6e","year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.906005Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:e291604db44779d2a9edd20503e3a8dd9cc777132b32647c28b52143c9be3f3b","observation_id":"29212bea-e7de-4e6e-b31a-6b796b5b31fc","resolution":{"observed_at":"2026-08-11T22:19:37.596158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.575002Z","title":"Online detection of action start in untrimmed, streaming videos","venue":null,"work_id":"3382076a-a66c-4ca1-bc95-584a6f29ddac","year":2018},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.911036Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:7456ea47c70215bdc912e1a2e3c858a010d13fc857df479f854aefa8f89666ad","observation_id":"2f888112-ea04-4b4a-9fd3-b580373c737d","resolution":{"observed_at":"2026-08-11T22:19:37.580179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.557218Z","title":"Startnet: Online detection of action start in untrimmed videos","venue":null,"work_id":"efa4395e-a4e8-4f47-98cb-2320c97dab64","year":2019},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.915931Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:dd5756aac1c0c81df5b0d928ecd841017597cddea57b932ab5dfb59f7a94e78f","observation_id":"9987ad6f-52a2-4689-b677-e87f5df82dfd","resolution":{"observed_at":"2026-08-11T22:19:37.562862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:35.921114Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.921114Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:ec6dee583091680831f83af897238fae4e25adf915062d6acf438b0d69a037f7","observation_id":"56713f94-baa9-4446-acc9-3fc256963f48","resolution":{"observed_at":"2026-08-11T22:19:35.921114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01670","last_updated":"2022-10-13T03:31:05Z","snapshot_observed_at":"2026-08-13T15:30:25.934143Z","submitted_at":"2022-06-03T16:28:58Z","title":"Egocentric Video-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01670","snapshot_observed_at":"2026-08-11T22:19:35.926281Z","title":"Egocentric video-language pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.926281Z"},"links":{"cited_paper":"/paper/2206.01670","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:c8ea6e85933a66057397f9d159b88664e21821aeda3a4a21d7e1e41529610a48","observation_id":"1b812691-a752-4ce6-88cb-27bf16d65a6e","resolution":{"observed_at":"2026-08-11T22:19:35.926281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.529194Z","title":"Span-based localizing network for natural language video localization","venue":null,"work_id":"75b53c08-8826-46f8-a5c8-63f9a362b029","year":2020},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.931447Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:8910e042e2a1faac82bb099d55518a4a3c29a2a8cbeb21f143a67f90a11c27cd","observation_id":"2a53c113-b245-4f1f-bcf2-90d3e6a6f925","resolution":{"observed_at":"2026-08-11T22:19:37.534691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T22:19:35.936017Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.936017Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:2f9cb18a677db31f4595f72392c2df9e1497c38a9e9761e006e6d3e1bef56aa8","observation_id":"9cca7515-4a8b-4acd-95b4-123bf70fa77b","resolution":{"observed_at":"2026-08-11T22:19:35.936017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:35.942005Z","title":"Kuehne, H","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.942005Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:63b34b1e8328ee897155eb698df057eaa02ce908e96ef51e282aa494673c646a","observation_id":"eb87b5e1-7eee-40a4-b30c-ecd3aaf4178e","resolution":{"observed_at":"2026-08-11T22:19:35.942005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:35.948967Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.948967Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:42810f7272690b571024623d3fd31a181d92f87a026d07c1800d6cda9c3cec1f","observation_id":"3e96aaa6-4c0f-4010-853f-ad26bf68cd64","resolution":{"observed_at":"2026-08-11T22:19:35.948967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.487852Z","title":"in the wild","venue":null,"work_id":"7a7d3818-e9a9-45aa-859e-359ca3347b3d","year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.954409Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:0d109c6e35a316a9f3edf632ffcfa3cb85a346dd22d46953dc93c3421894fc44","observation_id":"17a35831-3db2-4c60-9128-f107d27b428a","resolution":{"observed_at":"2026-08-11T22:19:37.492391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.468284Z","title":"Rethinking the faster r-cnn architecture for temporal action localization","venue":null,"work_id":"9c4a72e6-2c7d-4b85-8d57-b6ce211a2d17","year":2018},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.960213Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:8c9be8d0a43844a5b6e28045f764c87808b3b49df42c8e5ef2c91bb2f9ba1f64","observation_id":"37625abd-9bfa-465a-9f93-6a5736947860","resolution":{"observed_at":"2026-08-11T22:19:37.474810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.452118Z","title":"Temporal action localization in untrimmed videos via multi-stage cnns","venue":null,"work_id":"2571fdda-7cf6-42f6-bac9-308d8fdacd84","year":2016},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.966664Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:767c85298d251867f49be5e91f46c6d47f20965488064edb8fdd962f98dcd44a","observation_id":"79233e7b-a213-47e0-b37d-8f50f3458935","resolution":{"observed_at":"2026-08-11T22:19:37.457728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.435758Z","title":"X3d: Expanding architectures for efficient video recognition","venue":null,"work_id":"808d21b1-caca-4015-8ed5-b916951f613a","year":2020},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.972511Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:d1d21af84d8e24ea081bb4d97ba9675a27fd6d8af7bcc3ffa5dc12525f2744d5","observation_id":"3595a5b0-05b9-4bd5-8449-5221909475a6","resolution":{"observed_at":"2026-08-11T22:19:37.440793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.418709Z","title":"R-c3d: Region convolutional 3d network for temporal activity detection","venue":null,"work_id":"013b332a-31a0-42e6-9879-c6a4d62314e9","year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.977740Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:f3c897382b12544d7f9cac3edaac8dd16e800cd78d6640b194129a4b86a4d0f3","observation_id":"64ebd3e8-49f8-41a6-a128-b26a9ac60a0d","resolution":{"observed_at":"2026-08-11T22:19:37.424203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.401328Z","title":"Max-margin early event detectors","venue":null,"work_id":"96fc640b-0182-4fd8-93c3-e282bb452ee2","year":2014},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.983385Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:b86e4cb28d96252d3401937c5e946b9903083d048255bdb83d982a4a90aa864e","observation_id":"217e02f7-ba29-45e7-9d26-f26e93706ac1","resolution":{"observed_at":"2026-08-11T22:19:37.406425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.384685Z","title":"Learning activity progression in lstms for activity detection and early detection","venue":null,"work_id":"feb30bcf-9caf-4cbe-a77e-d9d05d8f5373","year":1942},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.989708Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:e30f96301a351d6b1592907a95c08588587206fab505159a75a07f3613141736","observation_id":"b6914812-be28-41cb-911c-7252508ab1f7","resolution":{"observed_at":"2026-08-11T22:19:37.389879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.364847Z","title":null,"venue":null,"work_id":"293052ca-663f-44bb-9ce4-8b540588b32d","year":2011},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:35.995929Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:22b33b511b1c1038626586c2ea665474cd70508670320cd4186d2b295e05d885","observation_id":"0868e5a1-5adf-48e2-94f5-e47af656acc1","resolution":{"observed_at":"2026-08-11T22:19:37.371237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.344071Z","title":"Temporal recurrent networks for online action detection","venue":null,"work_id":"399423cc-4ebb-45ae-88e6-5130a2060572","year":2019},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.002493Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:196221f0d85b4a40360dc74d25324ebfcfd4d640c7f100b2efd13e699dffed3a","observation_id":"e0a1143b-26ed-485a-a74e-58dbc6d8409b","resolution":{"observed_at":"2026-08-11T22:19:37.349815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.327013Z","title":"Activity forecasting","venue":null,"work_id":"eade3e79-7cea-4e41-a8e3-daea09b0e554","year":2012},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.007681Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:4e6c2dfa2993d1b60084c67078d12a598d2efe43b8b7c9c347440d605e150588","observation_id":"23470881-f16e-4b20-a1ab-d94d7da31906","resolution":{"observed_at":"2026-08-11T22:19:37.332313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.308801Z","title":"First-person activity forecasting with online inverse reinforcement learning","venue":null,"work_id":"ed3abf23-c037-4c52-b8a4-28fb249b938f","year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.013140Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:28fa7e7a3dfbdb654521b13d098627b76d0d86359e0926e95ee09472ac13c839","observation_id":"d092d4ea-6816-4a75-a8a0-53987841ccbe","resolution":{"observed_at":"2026-08-11T22:19:37.314399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.289250Z","title":"Rolling-unrolling lstms for action anticipation from first-person video","venue":null,"work_id":"e5e0efae-cf4a-493b-ad57-282b5349a1de","year":2020},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.018499Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:02bb56dbd7f0a9c540111aa4ef2b1ff9c5b9bc2121a4e570fcfa3cde0f61273d","observation_id":"17bac82d-735e-4550-899d-9f5a7ce9dc69","resolution":{"observed_at":"2026-08-11T22:19:37.294933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.270622Z","title":"Ego-topo: Environment affordances from egocentric video","venue":null,"work_id":"48f86699-0465-4a2c-bd17-6e446b73a865","year":2020},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.028080Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:34022ffa034ea9a91c42fba43eec2e2c6d6cf6b35e4efdd2acc0611ec8268f2b","observation_id":"0ded8fc6-6c38-4d31-b41b-d60d3da29fd9","resolution":{"observed_at":"2026-08-11T22:19:37.276268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.253745Z","title":"Anticipative video transformer","venue":null,"work_id":"97f1fded-9696-46b1-a04c-b7be138c7614","year":2021},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.033933Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:2c9f4f9085e0fa21473d412a531cda5faab6444b5aa69e19a57835bc9c692aa6","observation_id":"28a0c53c-d86c-4519-b8d3-25cd4ece9c47","resolution":{"observed_at":"2026-08-11T22:19:37.258896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.236109Z","title":"Memvit: Memory-augmented multiscale vision transformer for efficient long-term video recognition","venue":null,"work_id":"19796b72-7a8a-43f4-a49e-926f5054d59c","year":2022},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.040606Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:886ed91bbc1d998fed9f29ecdb4c088a5bf2add66e634318e62a8698310a19e7","observation_id":"033c94a0-4612-48ec-b7b1-0a6e77b4a5aa","resolution":{"observed_at":"2026-08-11T22:19:37.241639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.218257Z","title":"End-to-end concept word detection for video captioning, retrieval, and question answering","venue":null,"work_id":"3d778f23-dfa0-40b0-84f0-e6d89a64e4da","year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.046560Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:442d546d9b2817ba5090021fe238b25221adc44d1dd4ddc11de4dca6c9ea3364","observation_id":"d4ead645-aa73-493f-8889-33a7f6d27994","resolution":{"observed_at":"2026-08-11T22:19:37.223826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.052415Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.052415Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:4a88bd0a5ef28f220c9d392b9cd679522c3fc0aecf673c8038ac0ec29b83a822","observation_id":"90e86fd7-64d7-4c12-8112-748a4a2b665f","resolution":{"observed_at":"2026-08-11T22:19:36.052415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.189187Z","title":"Dense- captioning events in videos","venue":null,"work_id":"9741c616-66ed-4328-9651-f35bc4a97f8f","year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.058028Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:9ab401f94a8813da689e71667c20a2b0959d7fa1513a9a7d5a666ad51888c77f","observation_id":"def292db-f39d-4780-8667-fcd37d8b0c01","resolution":{"observed_at":"2026-08-11T22:19:37.194700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.169664Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"3a9fc1e7-0c33-467f-84b1-8042b1ed0060","year":2019},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.062887Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:e005886b956b16b6d4855d6b7a2bfbcd391bafadb62f05774c2cf512ccde2f4a","observation_id":"e2ebf1f2-e9bb-45d8-b6da-6769731c236d","resolution":{"observed_at":"2026-08-11T22:19:37.175555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.069418Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.069418Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:586f403ccbd8cd33f6762a9cddd038ebd1412f97e11ea87299164f55cb17ec18","observation_id":"fe4a09bf-fbff-45e1-8aac-8637c454a1c5","resolution":{"observed_at":"2026-08-11T22:19:36.069418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.137231Z","title":"End-to-end learning of visual representations from uncurated instructional videos","venue":null,"work_id":"fde33b54-cee8-4b82-b69e-038318313d92","year":2020},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.076263Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:f99b541039e25ef4af1795fc0ff7d021a06edeaa5276d8363ccbb0bbb3060ef8","observation_id":"090952f1-2c2e-49cb-9707-fe5445da7cf0","resolution":{"observed_at":"2026-08-11T22:19:37.143602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.082149Z","title":"Merlot: Multimodal neural script knowledge models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.082149Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:535f7afb80cebb8fbbee06780de6ab6e242fc3e75e6b6495d3eeb75fcfe0f229","observation_id":"9118c568-9fdf-4a20-8c09-dde3acf39d16","resolution":{"observed_at":"2026-08-11T22:19:36.082149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.107905Z","title":"Revisiting the “Video” in Video-Language Understanding","venue":null,"work_id":"a426ecf2-b0f3-4ca7-95ff-f1973e4abe65","year":2022},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.092886Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:fcd5ca3ca93a354d87df5e32c8bc4ba84db9f8bd377b3a05c0ef520c4cfb3e80","observation_id":"10c2122d-b3eb-41d9-9b5c-111db88b024c","resolution":{"observed_at":"2026-08-11T22:19:37.113499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.087050Z","title":"Localizing moments in video with temporal language","venue":null,"work_id":"19458cca-6836-4747-b08d-c4d436510c3c","year":2018},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.098090Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:2c8877b235c20dbad00b48fc37dd7bfab1dbbed4fb862fe899240ff4956a94a2","observation_id":"f1ba9f52-b2cf-45f4-8129-6cc92e5b9253","resolution":{"observed_at":"2026-08-11T22:19:37.093450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.069512Z","title":"What is more likely to happen next? video-and-language future event prediction","venue":null,"work_id":"71ccb560-56c8-4362-bde7-0175b2b96f25","year":2020},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.103633Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:fbe91a9cd4c2e8ef2cfa36ff166ce1382e519049f53da8621d0df0f966dd6e7d","observation_id":"45bc2236-c4ed-44af-a969-4343906c3b62","resolution":{"observed_at":"2026-08-11T22:19:37.074981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.052714Z","title":"Visu- alcomet: Reasoning about the dynamic context of a still image","venue":null,"work_id":"e31b902a-b2c4-45db-9529-b23d0156d963","year":2020},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.108848Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:0de2ec418e16bcad982055ad80499d8690d832bfc0c672027643825bade15475","observation_id":"2952fb86-22fa-44eb-9264-bda5139e79a1","resolution":{"observed_at":"2026-08-11T22:19:37.058228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.026253Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"0d0891b3-1876-4068-9a20-ec73f50b63d6","year":2018},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.114130Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:9d7e26f19fa08a454bff3d70bb02ab8b18596aa9354fb282db42c56b81cce606","observation_id":"aefd4d26-b2e4-4fc2-bc56-e82b2e4242aa","resolution":{"observed_at":"2026-08-11T22:19:37.032720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:37.008841Z","title":"The epic-kitchens dataset: Collection, challenges and baselines","venue":null,"work_id":"8f301046-10d9-41df-84bc-836d9c652e99","year":2021},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.119370Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:b99747c6c23f16c046a5c7d308bfe5183d3ea841fd07baf4f252e9935df9fda6","observation_id":"a25db8dc-b9de-4596-929c-7db4019b65c6","resolution":{"observed_at":"2026-08-11T22:19:37.014883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.124246Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.124246Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:1d02f45962611d24d4b17d7a1c5d80d367ddf84f44f6172bc48f4704cd64820a","observation_id":"b163c963-eef7-4b1f-9a7a-e44d671b51a6","resolution":{"observed_at":"2026-08-11T22:19:36.124246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.128869Z","title":"Learning video representations from large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.128869Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:fd9848559d5c7ec7dbded390d311b682051359feaadf5eec05174206b2b03f5c","observation_id":"6e6df43a-a522-4536-bca6-fa9e2b9f1e79","resolution":{"observed_at":"2026-08-11T22:19:36.128869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-12T23:34:48.223610Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-11T22:19:36.133814Z","title":"Egovideo: Exploring egocentric foundation model and downstream adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.133814Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:53b7c22f7ac4113c9bd55010b6e4bcd6db95853f98d4cbb3e12f60bef80241bd","observation_id":"5aaf6e72-929d-47cb-96e4-cd013ed643fd","resolution":{"observed_at":"2026-08-11T22:19:36.133814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15255","last_updated":"2023-06-27T07:27:52Z","snapshot_observed_at":"2026-08-13T11:08:39.683788Z","submitted_at":"2023-06-27T07:27:52Z","title":"GroundNLQ @ Ego4D Natural Language Queries Challenge 2023","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15255","snapshot_observed_at":"2026-08-11T22:19:36.139817Z","title":"Groundnlq@ ego4d natural language queries challenge 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.139817Z"},"links":{"cited_paper":"/paper/2306.15255","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:341c448fe965dd937f128e080777688e7d79d19878d04feb7b3186950ddaba94","observation_id":"df5d848e-b7a0-4b1b-831a-c8ed34997ad6","resolution":{"observed_at":"2026-08-11T22:19:36.139817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.968741Z","title":"Naq: Leveraging narrations as queries to supervise episodic memory","venue":null,"work_id":"06e25047-3e6d-4f3f-a59d-32258a9261a1","year":2023},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.145490Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:794e5b6888b662ae9613d1676c776cbd6b86316cfc4309a9c5d5023f4e936436","observation_id":"3fa363f7-048b-4639-9f9b-ec9d92b116c0","resolution":{"observed_at":"2026-08-11T22:19:36.973668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.150626Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.150626Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:43043ad943bbca9ae175c468e6fff97702e615c1557a7d5e3fc51adbe73d2621","observation_id":"60a5b9f0-8297-4e14-bd1f-d8e173015b7c","resolution":{"observed_at":"2026-08-11T22:19:36.150626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.155720Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.155720Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:7339264630d4c516bf2a5b3f3789f2f21156a55ea3afc0164bb299ca4cae6fd8","observation_id":"4ac5a7bf-6631-4b1d-8a76-c4451d702d5e","resolution":{"observed_at":"2026-08-11T22:19:36.155720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T22:19:36.161357Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.161357Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:7f88a60a5d74110f29f9f2031d2983a46346a6f44e4e2678e463741b1c86c3d6","observation_id":"4f49bb13-ee1c-476f-a4ab-c5ce4c550972","resolution":{"observed_at":"2026-08-11T22:19:36.161357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13535","last_updated":"2022-10-15T01:31:42Z","snapshot_observed_at":"2026-08-13T15:35:49.711086Z","submitted_at":"2022-05-26T17:56:15Z","title":"AdaptFormer: Adapting Vision Transformers for Scalable Visual Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13535","snapshot_observed_at":"2026-08-11T22:19:36.167003Z","title":"Adaptformer: Adapting vision transformers for scalable visual recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.167003Z"},"links":{"cited_paper":"/paper/2205.13535","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:924eb4ac83b87d8f2f80a5b6193d32be4bbecf1f4810a679d7ba2c1f42f488e3","observation_id":"e0bc3c39-4909-403e-8b4e-cdd0c051db9c","resolution":{"observed_at":"2026-08-11T22:19:36.167003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.928757Z","title":"St-adapter: Parameter- efficient image-to-video transfer learning, 2022","venue":null,"work_id":"9f6acab5-8257-4ae5-bcbf-a2e53f654913","year":2022},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.172264Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:f1fcdc735f520a8535e9f149478d9d2a09840241dfd04d143372a3e5d0a575dd","observation_id":"f3bf7c55-ef54-43fb-be23-496762ed082b","resolution":{"observed_at":"2026-08-11T22:19:36.934728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.909175Z","title":"Frozen clip models are efficient video learners","venue":null,"work_id":"3e43a448-fa1c-4d6d-b63f-3a75b7a03b4c","year":2022},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.177571Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:fd7ef6e4419d3e778ab66d43c9971a67f5bae608ef990c92efa8675513eff89b","observation_id":"7af8c68c-892a-4076-a122-2f095affd2b1","resolution":{"observed_at":"2026-08-11T22:19:36.914584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.883011Z","title":"Aim: Adapting image models for efficient video understanding","venue":null,"work_id":"9b847f4f-81fc-4076-a175-14815919eb0f","year":2023},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.182765Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:302e75d9d30523137b6a480ae140f9147198fe051f2e46493fa6cc5619e1d9fa","observation_id":"46b64eb2-eea2-42dc-b6a5-a3f1231a748b","resolution":{"observed_at":"2026-08-11T22:19:36.888735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.859034Z","title":"Disentangling spatial and temporal learning for efficient image-to-video transfer learning","venue":null,"work_id":"86ef898d-c542-4f9d-97f8-18764d6e56e9","year":2023},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.188556Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:6d8612bb9bb77ab192507767cc722b3226ee4dd6e4406e03b411d61c3f7391d6","observation_id":"c00e9dce-b033-4f53-abfe-ee62ad88c19f","resolution":{"observed_at":"2026-08-11T22:19:36.865351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.838834Z","title":"Side4video: Spatial-temporal side network for memory-efficient image-to-video transfer learning, 2023","venue":null,"work_id":"6bd024d6-1168-433a-b5f7-165587589072","year":2023},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.195158Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:35f2002d10d7266faa18198dc1499d43e76ce92b082f54e2dfdc697e15bbdc7a","observation_id":"675cd7fa-131a-47d8-bb44-a3027ff4549a","resolution":{"observed_at":"2026-08-11T22:19:36.845424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02887","last_updated":"2024-02-05T10:55:47Z","snapshot_observed_at":"2026-08-13T04:26:54.720814Z","submitted_at":"2024-02-05T10:55:47Z","title":"Time-, Memory- and Parameter-Efficient Visual Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02887","snapshot_observed_at":"2026-08-11T22:19:36.201691Z","title":"Time-, memory- and parameter-efficient visual adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.201691Z"},"links":{"cited_paper":"/paper/2402.02887","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:bcefb7a66df8063b9cf1df7d4a4de989debedd025f7a0404dd348648ebc590b9","observation_id":"dd538d8c-9af7-48bc-996d-9e6a411f0660","resolution":{"observed_at":"2026-08-11T22:19:36.201691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.819150Z","title":"Egoexolearn: A dataset for bridging asynchronous ego-and exo-centric view of procedural activities in real world","venue":null,"work_id":"f1d9b708-5fce-4a69-b216-336a0f887ef8","year":2024},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.208074Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:0c3f60b2a27abdd0931193a517ec48424f42159312cc1d2069e6ae49b4eb17bf","observation_id":"47ba70b4-cad5-4106-85a8-cd516b0bde2b","resolution":{"observed_at":"2026-08-11T22:19:36.825064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.213584Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.213584Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:6fddb456e13907c053159be276e668d50d273b69e00312431ebe35969f54c532","observation_id":"5be3fbc0-393e-45be-b8bd-7663ff997356","resolution":{"observed_at":"2026-08-11T22:19:36.213584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.219247Z","title":"Is space-time attention all you need for video understanding? In Proceedings of the International Conference on Machine Learning (ICML), July 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.219247Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:b6908b221927e6847f8658f8b7bd1aa3b86460846db68829c5fe3257dd69808b","observation_id":"2fee4b66-5467-40f8-9152-626ab0cbf74e","resolution":{"observed_at":"2026-08-11T22:19:36.219247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.773979Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"c090e2c6-1c32-4c55-befd-b356c2447377","year":2021},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.225165Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:179e6ac0bf35f57d0901dcadcbde16f160d307c7650cb614c0cf31af39652462","observation_id":"173660ea-dc9a-411e-96b2-15c18367b3d6","resolution":{"observed_at":"2026-08-11T22:19:36.779737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01576","last_updated":"2016-11-21T20:52:34Z","snapshot_observed_at":"2026-08-13T09:07:16.249454Z","submitted_at":"2016-11-05T00:31:25Z","title":"Quasi-Recurrent Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01576","snapshot_observed_at":"2026-08-11T22:19:36.229814Z","title":"Quasi-recurrent neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.229814Z"},"links":{"cited_paper":"/paper/1611.01576","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:dd2172eef2e505de542b105aca110d86510c552544369f22e439db9b285783eb","observation_id":"bc0cb778-52a8-4014-9391-4b4fe7549c26","resolution":{"observed_at":"2026-08-11T22:19:36.229814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.237168Z","title":"Retentive network: A successor to transformer for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.237168Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:a65d288ff8acb01f807c065b388cd84463568c3dddca09f73e7ff56d212cc87b","observation_id":"7bbc78b7-2beb-4d58-82b8-0b74573c2e02","resolution":{"observed_at":"2026-08-11T22:19:36.237168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.742029Z","title":"Attention is all you need","venue":null,"work_id":"273dcea9-9513-4c0d-9f8a-33a438cd830b","year":2017},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.243286Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:c76b38bf6723c5b5eb0ca29e122ebf843ac0d2bb5159dde1ec01cd35db31a878","observation_id":"84b24ae2-a1e8-4920-b786-bad750f74c4d","resolution":{"observed_at":"2026-08-11T22:19:36.748404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-08-13T09:44:21.186377Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-08-11T22:19:36.248756Z","title":"Quantifying the carbon emissions of machine learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.248756Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:1947b4fcf5b83dcfe5e84d382cff8b3a6ddc986ad2fc3ee6c1b747e547cdf213","observation_id":"54afe193-8c68-4df7-a615-5c11ee6e9b2e","resolution":{"observed_at":"2026-08-11T22:19:36.248756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08666","last_updated":"2022-05-20T00:45:40Z","snapshot_observed_at":"2026-08-13T19:38:07.404749Z","submitted_at":"2021-04-18T00:02:32Z","title":"Worst of Both Worlds: Biases Compound in Pre-trained Vision-and-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08666","snapshot_observed_at":"2026-08-11T22:19:36.255034Z","title":"Worst of both worlds: Biases compound in pre-trained vision-and-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.255034Z"},"links":{"cited_paper":"/paper/2104.08666","citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:04cbf3db3a9e5571192b9db4f1a1759faf58304df4d7fdfeb797b16ac5c0a7ab","observation_id":"4302b787-4fc1-4dbe-b1f4-51234a94b29a","resolution":{"observed_at":"2026-08-11T22:19:36.255034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.725872Z","title":null,"venue":null,"work_id":"e010815e-84d8-40bf-bc4b-f1f38821a80f","year":null},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.260208Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:2cf7dae7b2a03718c9c36a311cffa672ef18745cbf268d438c0ccbc5699a451f","observation_id":"40928d68-f089-4a78-9c12-a1b10b466b3d","resolution":{"observed_at":"2026-08-11T22:19:36.730820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.266075Z","title":"(a) Did you state the full set of assumptions of all theoretical results? [N/A] (b) Did you include complete proofs of all theoretical results? [N/A]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.266075Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:f5baec305e1d8393658a398cf1bef45da6ec7bda6ad7262ccb6e7c002b973de8","observation_id":"8b21d035-922d-478c-8fdb-d1c2e1ba55a6","resolution":{"observed_at":"2026-08-11T22:19:36.266075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.695205Z","title":"for benchmarks)","venue":null,"work_id":"dd195c29-8659-49bc-a61a-cd2d80f98821","year":null},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.274456Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:9cb149f0c03936ccb51287043318365a0b062e3dbd680a45f996d8560e4bf8bf","observation_id":"f7dff473-5197-4fd0-b26f-11aa6903addf","resolution":{"observed_at":"2026-08-11T22:19:36.701186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.675119Z","title":"(a) If your work uses existing assets, did you cite the creators? [Yes]","venue":null,"work_id":"7bcb0454-54fa-4322-a2d9-e61fddd0effb","year":null},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.281198Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:911a4910c4e533a16624540aa9b668d951acc1ff2788741293ea6a0475af6f5a","observation_id":"2a20f179-26b6-4128-8400-9d0a28543c65","resolution":{"observed_at":"2026-08-11T22:19:36.680939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.655760Z","title":null,"venue":null,"work_id":"a49cb2f8-a385-4c2c-a8e1-823abab45d97","year":null},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.287466Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:a021c8e11f0440e9a6d1d3d0676cbfa783d60983bb6702553c4428b541824607","observation_id":"8068d5ba-0416-4b86-942c-2e40d85e8b20","resolution":{"observed_at":"2026-08-11T22:19:36.661740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.637398Z","title":"Recommended documentation frameworks include datasheets for datasets, dataset nutrition labels, data statements for NLP, and accountability frameworks","venue":null,"work_id":"a571cc19-9b05-4d2e-9f6e-6c81ea686692","year":null},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.294292Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:8d94e1dbe7dd7626c31e4cc55fea64e7fd7e0fd89fc2bdb59a621cb528352818","observation_id":"3badf32c-d71a-4989-9574-aefa02ea35e3","resolution":{"observed_at":"2026-08-11T22:19:36.643818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.617835Z","title":"• Both data and metadata are hosted in the Github repository associated with the website github.com/sdqesdataset/sdqesdataset.github.io/","venue":null,"work_id":"f583aa13-5e7c-40d4-a8ec-138e69bedeb6","year":null},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.301865Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:68467cb55dd22cea2525f141d11f53d2cb92c9ba1bc55c38131df7a6eb298b48","observation_id":"04c18167-b41f-4d29-b3c5-729aecf62627","resolution":{"observed_at":"2026-08-11T22:19:36.625541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.597222Z","title":"batch dimension","venue":null,"work_id":"071e4d68-712c-49f0-83d4-2ce06b781391","year":null},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.308421Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:770f157a5f8496d0f03731f8ecda31195082579dfede6b14a53498d9b34d1f62","observation_id":"4600d870-ba77-4ef9-8435-d921ad41bfa0","resolution":{"observed_at":"2026-08-11T22:19:36.603415Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:36.572780Z","title":"query\":","venue":null,"work_id":"d732471d-3801-41d6-96a1-c7753ad8d8cc","year":2019},"citing_paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:36.314950Z"},"links":{"citing_paper":"/paper/2412.03567"},"observation_digest":"sha256:afe8a9b4817523a7e6cc1dc8ddd36a9ecf623589497524989d19f296c755eb59","observation_id":"d89c71d0-23d2-4d62-91fb-c623f101ef16","resolution":{"observed_at":"2026-08-11T22:19:36.580532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03567","last_updated":"2024-12-04T18:58:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:58:31.756661Z","submitted_at":"2024-12-04T18:58:27Z","title":"Streaming Detection of Queried Event Start"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2412.03567."}