{"as_of":"2026-08-12T15:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f49dd83063234e2f16b7aa997be582b5eff33a9ee16f235773325baddefd962","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:55:40.639778Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.13708/citation-record","integrity":"/paper/2412.13708/integrity","json":"/paper/2412.13708/citation-record.json","paper":"/paper/2412.13708"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.428503Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.428503Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:4c33d17654c3b12d2d3660ac582d569a6a67b01e9f4d93a22edd34a40c226b10","observation_id":"a55fa959-480a-4e4d-8505-88252dfbde7d","resolution":{"observed_at":"2026-08-11T12:55:40.428503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.433370Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.433370Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:b7eefd29595ab2f75f8e8e02545a8e9d12ec0d38384b05369e5637f94b693b36","observation_id":"24f2cfe8-ad86-48b6-949d-6efa8ba4e8a1","resolution":{"observed_at":"2026-08-11T12:55:40.433370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.438612Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.438612Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:94dec266b4d4b3dbb4214d82885dcb3f49523afb22ed43d6d2abc37f5e6ad2aa","observation_id":"c1b73cb2-b166-4487-bc7f-3f17c10765cd","resolution":{"observed_at":"2026-08-11T12:55:40.438612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.442800Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.442800Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:1f6d2ebfcd1eda696201db2d5f7d8e04949942e1c6d6c02593d98e3c8483d1db","observation_id":"75a1cf3c-b12b-4a93-bdb1-e80dbc623dfa","resolution":{"observed_at":"2026-08-11T12:55:40.442800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-11T12:55:40.446779Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.446779Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:8c3ddab1e7b79fe667a204f9b0994b5b590980f64773634347c8a614814124f3","observation_id":"2475eacc-e50e-420f-9479-7bdd271a6214","resolution":{"observed_at":"2026-08-11T12:55:40.446779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.447659Z","title":null,"venue":null,"work_id":"99c0b9d4-244e-4050-ac99-60215d017b79","year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.451247Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:251df584e07d62ffc330774634fd3697397f03f0ccb3699bc540a32a34d0608f","observation_id":"ac60db86-b09a-46d5-a22f-6d4b7a99f7f1","resolution":{"observed_at":"2026-08-11T12:55:41.454325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.427946Z","title":null,"venue":null,"work_id":"4df60a66-c32b-4a92-8b47-fe19c57847c3","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.455258Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:30bdac429ae2fd457ab7d5a2e662f08c83bb3522bc15e913726c8e99af7f5945","observation_id":"3a805d6b-195b-4e1a-9fca-4443e143c61b","resolution":{"observed_at":"2026-08-11T12:55:41.434419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.410435Z","title":null,"venue":null,"work_id":"048eca1b-2d8a-41f8-b4ba-16629aa0f83d","year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.459611Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:78174da11c7461bca51913ce95038e856c19d05a8749f38e1ad35a908b582d50","observation_id":"64f6b389-54c3-45a6-bce6-fbbbd244a872","resolution":{"observed_at":"2026-08-11T12:55:41.415302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.392609Z","title":null,"venue":null,"work_id":"a7501b7a-9336-439d-a240-08cf25e164a3","year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.463881Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:355d9e02a158ca5c243ab74f6a14d5defd081b72a26b8480a67ab673493c5fe7","observation_id":"7944b528-d905-44e9-9697-f183ce768dcc","resolution":{"observed_at":"2026-08-11T12:55:41.399617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T12:55:40.467477Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.467477Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:dd623482c30a095cefc98bd353a507e7620688a09a342217c0df710daf2f2042","observation_id":"5c17b6b8-1f88-409f-8de0-029a5fb0f594","resolution":{"observed_at":"2026-08-11T12:55:40.467477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.378782Z","title":"J.; Chen, M.-H.; and Lai, S.-H","venue":null,"work_id":"7f120ab3-cd2e-4ef6-9068-3ee1f4229ef5","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.471327Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:cf598e5f29614df885eef215d65b52c0580e287e172598379cd36de143e104c9","observation_id":"977346c9-edac-4f7a-8cad-fadbb732a77e","resolution":{"observed_at":"2026-08-11T12:55:41.383051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.475016Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.475016Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:02b81fdd4f95c0a9016147b5a7139998791d9872b57729a462f2d35dd0855cc6","observation_id":"ea33e2c0-dbad-440e-a249-e521c1fb30dc","resolution":{"observed_at":"2026-08-11T12:55:40.475016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.350476Z","title":null,"venue":null,"work_id":"264defec-0eb8-4ecc-836b-560f183013ec","year":2020},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.478714Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:d0a64273840055b35bbd8e43ef4d97dd9d0becfd383d11ace736e0383f7febbf","observation_id":"24b63ce3-f5a7-4951-b89d-39210e98627e","resolution":{"observed_at":"2026-08-11T12:55:41.358092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.333915Z","title":"T.; Lucic, M.; Schmid, C.; and Arnab, A","venue":null,"work_id":"4804a417-a38a-4ddc-a6fe-070a41c87e14","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.482436Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:3835ed6e65deba3c0a05c18eacebcee07b13ea75aa6f75195716a34c79d32679","observation_id":"d503d68a-8b5d-40a9-aa5d-a59bb8841a1a","resolution":{"observed_at":"2026-08-11T12:55:41.339494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.314126Z","title":null,"venue":null,"work_id":"178376f8-8ffd-46cd-b3b6-0287d28ac8c9","year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.486265Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:7408ca3836fb5ac4c84cbaaf690db98b00012d76a5bffc262c79266c6ac67fe0","observation_id":"c02d590a-3ba9-4349-ab70-5f6a354f4b4e","resolution":{"observed_at":"2026-08-11T12:55:41.319899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.293209Z","title":null,"venue":null,"work_id":"45b4d09c-5e85-4f34-8e80-2fce75bc2158","year":2015},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.489968Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:832e27b452ac7d611909e42a639327fb2bd92208a1f08f817540554608634a40","observation_id":"bdda318a-d27f-4813-ae81-0483b2b6c185","resolution":{"observed_at":"2026-08-11T12:55:41.298649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-11T12:55:40.493993Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.493993Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:8bf72d2fc87c3980e0dda4902c430366e20361a12e3111771fa16f70ccb1d66c","observation_id":"60d2415f-45f7-4951-8eb2-4215c87f07df","resolution":{"observed_at":"2026-08-11T12:55:40.493993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-10T17:21:19.608137Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-11T12:55:40.498345Z","title":"H.; Harwath, D.; Karlinsky, L.; Kuehne, H.; and Glass, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.498345Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:b56c1583fd9c7d618928f081a48f0732555c09c268b440a708b5a632c719c50d","observation_id":"a89a43ff-8a4f-459a-8418-c6a3b65d07b2","resolution":{"observed_at":"2026-08-11T12:55:40.498345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.275301Z","title":"A.; Vondrick, C.; Pantofaru, C.; Li, Y.; Vijayanarasimhan, S.; Toderici, G.; Ricco, S.; Sukthankar, R.; et al","venue":null,"work_id":"17a0f1de-2ac3-4d13-a403-3531227996b7","year":2018},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.502880Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:be4267a74df3066e01285b63c84c384d41b3d47e8fb85398d74b63e3386edb95","observation_id":"305759ce-104a-4164-a25c-fa523f5d9cae","resolution":{"observed_at":"2026-08-11T12:55:41.281077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.507997Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.507997Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:eaccdc051874ce2d848bb4406f212a42dfeec2ed6ccedbde1c9fefd862fa3835","observation_id":"dff77b8d-d5a3-4b7d-856e-17b843b699bb","resolution":{"observed_at":"2026-08-11T12:55:40.507997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.251016Z","title":null,"venue":null,"work_id":"f704b177-39c1-48e5-aea4-7ba69d5d1564","year":2024},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.511930Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:efb3435094c9ebb77f2ecb01a3259516c501063715a0c5a2dad759fd937018cd","observation_id":"3147dfb7-787e-48d2-9f3e-82e9426593ee","resolution":{"observed_at":"2026-08-11T12:55:41.256140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.233149Z","title":null,"venue":null,"work_id":"ea3e1296-2bd5-497f-aa5d-b70f8024e174","year":2013},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.515670Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:7478d6e3e563425d04573c56a627b909e24ef2e2c0ba69af5b08892f8b1e27f1","observation_id":"356d6ac5-ac91-494c-9601-9b9a04be8174","resolution":{"observed_at":"2026-08-11T12:55:41.238666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T12:55:40.519804Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.519804Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:7945c041e93709dd2b2baa33b8d18b415cb9d535cca835c4d8b397c58c89a973","observation_id":"dffa1ae0-5344-414f-aa9e-422b17c87bfa","resolution":{"observed_at":"2026-08-11T12:55:40.519804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.218747Z","title":null,"venue":null,"work_id":"9637f03a-4331-4c16-aabf-f5dccc025fb3","year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.523971Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:a31cad26db7200ba3dd740428f5743e5ac994837772a0a609b9393b18d3834a1","observation_id":"087b909d-170b-46a6-91c9-d0a82962d309","resolution":{"observed_at":"2026-08-11T12:55:41.222855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.203511Z","title":null,"venue":null,"work_id":"d4f73c41-017b-41f2-95a2-9aa4bcb358df","year":2018},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.528176Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:fe25ce20c76906665956332a60657e1f1a64acb021a51b3ec847dd244e71fc33","observation_id":"7cde3c3b-1888-47fa-87b2-3b18e41938a7","resolution":{"observed_at":"2026-08-11T12:55:41.208481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06644","last_updated":"2021-10-18T12:53:47Z","snapshot_observed_at":"2026-07-06T08:37:17.482124Z","submitted_at":"2019-11-15T14:09:47Z","title":"You Only Watch Once: A Unified CNN Architecture for Real-Time Spatiotemporal Action Localization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06644","snapshot_observed_at":"2026-08-11T12:55:40.531944Z","title":"o p \\\"u kl \\","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.531944Z"},"links":{"cited_paper":"/paper/1911.06644","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:fd02c35c639f9e01a787283529bddbd7e9200a11403640234033c648c9b69d00","observation_id":"b1617dc8-b33e-4195-878b-a8bd6d4a1038","resolution":{"observed_at":"2026-08-11T12:55:40.531944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.535979Z","title":"A.; et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.535979Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:1fa2d276b940253cb58d6918bda67cc7d06202a8e7c86f340f7b06611f37d871","observation_id":"a54e25f5-827e-43a9-983b-0500ae422b4f","resolution":{"observed_at":"2026-08-11T12:55:40.535979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.171909Z","title":"H.; Son, T.; Seo, S","venue":null,"work_id":"4f6bd648-7a3d-4b89-b7f3-081f2bcc07b6","year":2024},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.539546Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:df7fe631e612a9f28b5626dd5211caeffcadce5fae1326a8026000de7e2b55b9","observation_id":"814f85c3-7ccc-4ab6-ab62-965f3165c038","resolution":{"observed_at":"2026-08-11T12:55:41.176602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.543150Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.543150Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:a99197a2c1e30ab1ee398dd4080f886c57050c65f856c3b97f9bb6b25f0f8647","observation_id":"19d65c45-80e5-408d-9083-836790fb8898","resolution":{"observed_at":"2026-08-11T12:55:40.543150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.146811Z","title":null,"venue":null,"work_id":"ae4a9197-fe70-4f0b-8fd5-e581f9c44819","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.546696Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:27f6fbb47d00fd3caa787cd74e06dd91c34a253a05ce90c97322e019f2acf9dd","observation_id":"13c92f4a-d438-4a27-aa27-5ec250402eb6","resolution":{"observed_at":"2026-08-11T12:55:41.152030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.126094Z","title":null,"venue":null,"work_id":"8c85a11e-1505-4ad5-8c84-fb73f156310c","year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.550328Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:660109db117b7f35b6257270d38cfaf2d255fc52cbf4136abcfe70cdb66c0002","observation_id":"a04b8739-23d1-41bd-b03f-3081636385b6","resolution":{"observed_at":"2026-08-11T12:55:41.131433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.554245Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.554245Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:487167b74a57ba5126f34d9f810f7114665d828a67e28e935ec905829cec2f8e","observation_id":"363c498b-5c6f-44f9-bd90-612a033b90c3","resolution":{"observed_at":"2026-08-11T12:55:40.554245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.558155Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.558155Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:0ca14ad2dbeb3f633ceecb04fcc7819589f4501699b6469807d72b98767c1861","observation_id":"45e5a747-c4e6-46da-918b-54d145e61f44","resolution":{"observed_at":"2026-08-11T12:55:40.558155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.091055Z","title":null,"venue":null,"work_id":"370c53f4-7c49-4efe-bf27-bae233761631","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.562111Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:94a3db45c5392c731eea162254bfa297575453cff230ff45a4a529d8916e091a","observation_id":"41a91923-510d-4889-98d5-7ef499bf0466","resolution":{"observed_at":"2026-08-11T12:55:41.096668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.565970Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.565970Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:a28f31085d61bdb3d0e3d293512033b8a32fc75e5f8ed726151533aaa699c2cf","observation_id":"15d505bb-ccd8-42cd-b073-21c906efc6f8","resolution":{"observed_at":"2026-08-11T12:55:40.565970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.067528Z","title":"Z.; Liu, Y.; Shao, J.; and Li, H","venue":null,"work_id":"9d60e7cb-3d08-42f4-a30e-492973193a7e","year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.569806Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:2363b3b1e24b17183d5bfb9ae8fa1f990180606fb5df87cc06970fb24dd27c37","observation_id":"3b65daa9-2bff-4aa0-8c22-b2a2651573ab","resolution":{"observed_at":"2026-08-11T12:55:41.072911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08779","last_updated":"2019-12-03T18:19:07Z","snapshot_observed_at":"2026-08-11T22:56:31.055611Z","submitted_at":"2019-04-18T17:53:38Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08779","snapshot_observed_at":"2026-08-11T12:55:40.573731Z","title":"S.; Chan, W.; Zhang, Y.; Chiu, C.-C.; Zoph, B.; Cubuk, E","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.573731Z"},"links":{"cited_paper":"/paper/1904.08779","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:381acd4cf82ae25234fd27b94649bcf2ad6b7d349858f2a44b32cd31ad7185cd","observation_id":"2413dcaa-af59-4b29-83df-05f6b82ac1e6","resolution":{"observed_at":"2026-08-11T12:55:40.573731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.053547Z","title":null,"venue":null,"work_id":"e0068fbd-d986-41e6-b9a7-40d8af95cb3c","year":2015},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.577480Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:798dd281230d9cc8f6cd37b699ed36b315fe105659a86e770b7a8c8923ccf009","observation_id":"7f93223e-3e96-4a6d-a783-2fb0b38d3043","resolution":{"observed_at":"2026-08-11T12:55:41.058900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.581176Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.581176Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:de13c7857355a7685cae58fc78834ed1d5df273997145b2a00db7138d77f8b82","observation_id":"47c79d50-4652-4ce6-abac-6bc9169e90c5","resolution":{"observed_at":"2026-08-11T12:55:40.581176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.01529","last_updated":"2016-08-04T13:38:38Z","snapshot_observed_at":"2026-08-08T12:11:04.046906Z","submitted_at":"2016-08-04T13:38:38Z","title":"Deep Learning for Detecting Multiple Space-Time Action Tubes in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.01529","snapshot_observed_at":"2026-08-11T12:55:40.585130Z","title":"H.; and Cuzzolin, F","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.585130Z"},"links":{"cited_paper":"/paper/1608.01529","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:662a00065b99ea3bf3a4dee893ec9fb06d264912a12882066dcbe1f12fa5bdf6","observation_id":"4e949dc3-f017-414c-bc10-7179bf1f63f9","resolution":{"observed_at":"2026-08-11T12:55:40.585130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-11T12:55:40.589224Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.589224Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:33d68bd4c933c4d478f78a3784be583b3e4eadf1fb77dc9a6cb46eda33d81d22","observation_id":"cfe454bf-ca58-4c93-abb6-8c74605dfb83","resolution":{"observed_at":"2026-08-11T12:55:40.589224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.031973Z","title":null,"venue":null,"work_id":"c20b63b5-0517-4240-850b-3e503b1172bc","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.593204Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:2f7f7c1e6049130c79de200abb3ef33df6f12a91f3711ff13104980479f6b6da","observation_id":"29494328-6bab-402a-b9b6-28944f9bbbf5","resolution":{"observed_at":"2026-08-11T12:55:41.036220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T12:55:40.597484Z","title":"R.; and Shah, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.597484Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:27c9a80b8550659dc004f172cc82a088a4c29d952fd94c2feddede0a05954acc","observation_id":"b9d6aeec-8ca0-4299-a838-74618007741f","resolution":{"observed_at":"2026-08-11T12:55:40.597484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.015724Z","title":null,"venue":null,"work_id":"0d967f48-1e32-4b48-a3c3-29aaff69b15a","year":2020},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.601932Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:2673d972d33ca28f0ee1118ec9d001ea4cd3b667323d82777f0e930fe4fa2391","observation_id":"d4ae5fa7-1622-464f-a933-ba696d41ee7d","resolution":{"observed_at":"2026-08-11T12:55:41.020622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.605409Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.605409Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:48ab723b91f117b540a9c0eff655c500f0a5acb24bbfa613488411697dd34c50","observation_id":"1d0d9565-77a7-40a4-b853-469219c6ee9a","resolution":{"observed_at":"2026-08-11T12:55:40.605409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.609163Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.609163Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:b5250905e8d3ba824c320a9f5b208083efa2848298101d5c7edbaba52ff2f5f2","observation_id":"ed842472-5038-4a52-a5b0-7fca2aee138a","resolution":{"observed_at":"2026-08-11T12:55:40.609163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.979152Z","title":null,"venue":null,"work_id":"938fa7bd-0a4e-460d-a143-2ee1a3c2d8eb","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.613438Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:09483d0e36fe194f5e8ae5e6cf21fac0cb6c2be6365c80e17e8c28027b7e8030","observation_id":"c9fb8d32-4b4a-49d1-ab00-02a1d0800b20","resolution":{"observed_at":"2026-08-11T12:55:40.984876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.962036Z","title":null,"venue":null,"work_id":"816b1fd5-c3d7-4d6a-8cfd-b9b5dfc173d0","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.617275Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:aba49438be840f09941083f3f52560555a24024567f70f13ee57cac4b509a7ab","observation_id":"c2dc8310-4ff1-445a-ad40-1033ddcb3200","resolution":{"observed_at":"2026-08-11T12:55:40.967462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.946437Z","title":null,"venue":null,"work_id":"17ca4f13-ff31-4405-adac-a1b87b71fa30","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.620818Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:2f5086452a1580fa4cf807f8e59a128eddc8cbd5dbc6c996c26e172df96e417a","observation_id":"3abcb923-6297-4b33-adcc-4c35bfdb5237","resolution":{"observed_at":"2026-08-11T12:55:40.950862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.927390Z","title":null,"venue":null,"work_id":"7cbee06a-4f89-4619-966d-4a509717ba13","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.624525Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:3697624565c9f38d690fd675708101af1978e8305c9fa1d0b9d70067e88725d9","observation_id":"7eac1c72-cc63-433d-a3bf-fefd9f54dfee","resolution":{"observed_at":"2026-08-11T12:55:40.931771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-08-09T00:43:35.974628Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-11T12:55:40.628431Z","title":"J.; Grauman, K.; Malik, J.; and Feichtenhofer, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.628431Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:636ae5a1e2b59e6c211bec8db693d28e35a4f5d311aac3f0c28c3e381cade94b","observation_id":"cb902e94-8343-49c6-bb5f-be16609e9d7e","resolution":{"observed_at":"2026-08-11T12:55:40.628431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.910769Z","title":null,"venue":null,"work_id":"83e74689-58b2-4297-bfb3-d0dfc39ad55d","year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.632386Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:280d1db43583fd92a8462808cf98594218e094399d978eb23b1a8b552de1863a","observation_id":"8364e2e3-d165-48cf-8af7-145c7def52ca","resolution":{"observed_at":"2026-08-11T12:55:40.917455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.892008Z","title":null,"venue":null,"work_id":"70fdc851-701e-48af-9fbf-cd25f0c0a0ee","year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.636153Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:871026a9299c481289d9685600aa52d2a25ace8bae0ed4ebd0f5d76ba85e9413","observation_id":"7eef2d61-41be-4611-adda-515b6238e79c","resolution":{"observed_at":"2026-08-11T12:55:40.900699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.876812Z","title":null,"venue":null,"work_id":"b1e6f26d-68b1-46bb-a459-80a8fd6375af","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.639778Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:cb2cc6f416ada261ec970dd3a4df23fb1b8cbc3bb78fb1dacc5dce85f1f18514","observation_id":"d3535ca3-48d9-4c7c-9b4a-29ec74df0c21","resolution":{"observed_at":"2026-08-11T12:55:40.881941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T12:50:23.483212Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2412.13708."}