{"as_of":"2026-08-08T08:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b965bd69e76801fb234ea17b61c5a36e8decf615611235a16995b5138b5d88da","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:00:14.310613Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.02743/citation-record","integrity":"/paper/2512.02743/integrity","json":"/paper/2512.02743/citation-record.json","paper":"/paper/2512.02743"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-06T03:32:00.098200Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-03T19:00:12.936776Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:12.936776Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:3b8f28b7173cd80234d5397f8ff3159a4a1b6e80aab14049f0e05660a4784bf4","observation_id":"512e385e-51a5-42bc-a25e-99820ab7032c","resolution":{"observed_at":"2026-08-03T19:00:12.936776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T19:00:12.947544Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:12.947544Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:f068e1c090b031e73e62dd1bdaaf15fd8447106f7a2bd26c6ac490a719bbf74b","observation_id":"b19fce9d-ed69-4209-a745-131824d0aae1","resolution":{"observed_at":"2026-08-03T19:00:12.947544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01271","last_updated":"2018-04-19T14:32:38Z","snapshot_observed_at":"2026-07-06T06:26:27.965096Z","submitted_at":"2018-03-04T00:20:29Z","title":"An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01271","snapshot_observed_at":"2026-08-03T19:00:12.955774Z","title":"Zico Kolter, and Vladlen Koltun","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:12.955774Z"},"links":{"cited_paper":"/paper/1803.01271","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:b5cd1a839113190fb28fec5725456166b285357078975e4c29f5a922c2fe510e","observation_id":"2043f64c-a5a9-4621-8e44-65792eecee2a","resolution":{"observed_at":"2026-08-03T19:00:12.955774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.071663Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.071663Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:a82a2ad542b11a5d3d0cd453e1f1092420fbb3ee146aaf4583f614b3788442bc","observation_id":"a95c2305-d21a-43b0-839a-74f8b19fd8b7","resolution":{"observed_at":"2026-08-03T19:00:14.071663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.088415Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.088415Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:7541ddee1784b1b15db7da65434ea8e200e3be7524af8d74c6c7f4772b7ed055","observation_id":"9d951c0f-5329-4e4a-a414-4a43bd0e7b37","resolution":{"observed_at":"2026-08-03T19:00:14.088415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.094098Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.094098Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:2cdd105518b91535ce0b091419c265289b6b080ac17334197463836264ddea55","observation_id":"2ac6dd4f-fa6d-45c3-bb7e-d60c8c497d52","resolution":{"observed_at":"2026-08-03T19:00:14.094098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.106098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.106098Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:e7e2d0ce3494d5b4080461676e4d4081df803328abe5ab4adb71ced364d4f534","observation_id":"87e6a497-b46e-4151-a442-98110495c31c","resolution":{"observed_at":"2026-08-03T19:00:14.106098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.112129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.112129Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:ebb7800eb515a0649bd2965e0c24049483a2d95558dd31567f28a6f80e3ce0bb","observation_id":"8add3900-9b8a-419c-9dfc-63554d8de6a7","resolution":{"observed_at":"2026-08-03T19:00:14.112129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.116772Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.116772Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:89492f464b6501661961b479ea98e84d36598244ecd0c2dccef163a596c6680d","observation_id":"11559527-5c7a-4a22-b91d-df01945b9384","resolution":{"observed_at":"2026-08-03T19:00:14.116772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.123421Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.123421Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:b75d2c218b77061f68c462b0448af023d18a54d593e3f624a3b203a62c732ef0","observation_id":"4843805e-9240-4c2a-bf1d-f67eb8d5dc3d","resolution":{"observed_at":"2026-08-03T19:00:14.123421Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T19:00:14.128838Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.128838Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:9166d542aa97a110dea9dfa05a20b4c0ccf3906d6431733eb5b02bf93a749c33","observation_id":"5d02b55d-c49a-4ad9-9394-d2afb9db72d3","resolution":{"observed_at":"2026-08-03T19:00:14.128838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-07-06T16:17:07.927369Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-03T19:00:14.134519Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.134519Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:e36f3974dfbb52676aae67b940b2396b6ba9d0726c27eb9df11480ed01276008","observation_id":"ac7a9a48-9cd1-43a8-ae44-9dccf9fa0056","resolution":{"observed_at":"2026-08-03T19:00:14.134519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.139686Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.139686Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:1084998a857a2e34eb9154aaeaa76aed49cde58c29076e88d660fd765bb24357","observation_id":"c72c3a57-89bb-483c-a877-d21fe5a63c0b","resolution":{"observed_at":"2026-08-03T19:00:14.139686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00927","last_updated":"2025-07-11T15:49:30Z","snapshot_observed_at":"2026-08-07T16:17:02.389734Z","submitted_at":"2025-04-01T15:59:32Z","title":"Multi-Token Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00927","snapshot_observed_at":"2026-08-03T19:00:14.145243Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.145243Z"},"links":{"cited_paper":"/paper/2504.00927","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:4f7816ff96aa6e1dc4bcd9b411c8cd431f60fa1c20b8260f4ee4a2e7d8c8db73","observation_id":"ff973889-ad21-4283-b08a-14e6a95d60fe","resolution":{"observed_at":"2026-08-03T19:00:14.145243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.150728Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.150728Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:fbe296c8b9ea68573bc5e75a078067c12ad85f0eec42c5626e7fd81ee918504e","observation_id":"20209c5f-e23b-4975-b25b-d10a8f2cca74","resolution":{"observed_at":"2026-08-03T19:00:14.150728Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11073","last_updated":"2025-02-16T10:45:40Z","snapshot_observed_at":"2026-08-07T18:14:57.821301Z","submitted_at":"2025-02-16T10:45:40Z","title":"Demystifying Hateful Content: Leveraging Large Multimodal Models for Hateful Meme Detection with Explainable Decisions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11073","snapshot_observed_at":"2026-08-03T19:00:14.156010Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.156010Z"},"links":{"cited_paper":"/paper/2502.11073","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:0ccbb605aa13cb940c31a17600ea5c4e0266b7b316391364da8bd31e8165b94f","observation_id":"a71eab65-c214-4faf-a293-30bdf1523df3","resolution":{"observed_at":"2026-08-03T19:00:14.156010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.254","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"91d73de3-54ca-4352-be17-7c72aeb0b9d4","year":2024},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.162181Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:b9f031c4ba053f49a6f898508b275e1da815139f4b121daa6582cce9cbe4d0f6","observation_id":"33d8be74-1056-48ab-b509-5710b7c6bf0f","resolution":{"observed_at":"2026-08-03T19:03:33.314841Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.166677Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.166677Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:58ce390261fd2c32f1d5dfc45c3b01a6fc98501fc5a8df2aff9157d2b7af4089","observation_id":"c88f7d60-e102-4740-95a2-4f4089436e27","resolution":{"observed_at":"2026-08-03T19:00:14.166677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.172035Z","title":"Koushik, Diptesh Kanojia, and Helen Treharne","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.172035Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:064f77f74d3f0d2f7ca336ffcc7307ade6422e27b0d422923d8245ced458754b","observation_id":"d1d99181-79d6-47cd-a268-be55e2245f90","resolution":{"observed_at":"2026-08-03T19:00:14.172035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.182902Z","title":"Le Cun, B","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.182902Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:06adceda9f013507ceb4ee62e0f6c977764726a1e25aad1468cfa5aa9a68c035","observation_id":"34639197-cd80-425d-baff-ad10ea69b2b2","resolution":{"observed_at":"2026-08-03T19:00:14.182902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.187743Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.187743Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:c31e1ce6e941186fa6544434d4ad80eef669a6b85720d99cdecb39af841f682f","observation_id":"725822c5-e5bb-428f-9b9c-0a1695c76085","resolution":{"observed_at":"2026-08-03T19:00:14.187743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.198940Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.198940Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:58aba39f97bc37051fbb36df9918ee705e311b7998dcc3934d090280bd110c3a","observation_id":"2ac3ccf2-b7ee-488a-bbb8-21a70d27839c","resolution":{"observed_at":"2026-08-03T19:00:14.198940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-03T19:00:14.203624Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.203624Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:d1b980e4fa185b6b7791227847d69243f33b7f709d94d7310827e9672a9d1ccd","observation_id":"67182029-bc2d-43f7-8b69-4e3738765acc","resolution":{"observed_at":"2026-08-03T19:00:14.203624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w19-3511","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"98b0147f-b9a7-4eb1-8822-5164941d346c","year":2019},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.208288Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:7194c2b688017402c119b8270e70e3e906f025dc6857505b9576955854e75bf0","observation_id":"23bde998-7978-442f-ba04-c103245e856b","resolution":{"observed_at":"2026-08-03T19:03:33.211785Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1003.4083","last_updated":"2010-03-22T06:39:55Z","snapshot_observed_at":"2026-08-02T13:37:36.963826Z","submitted_at":"2010-03-22T06:39:55Z","title":"Voice Recognition Algorithms using Mel Frequency Cepstral Coefficient (MFCC) and Dynamic Time Warping (DTW) Techniques","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1003.4083","snapshot_observed_at":"2026-08-03T19:00:14.212980Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.212980Z"},"links":{"cited_paper":"/paper/1003.4083","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:decd970fc33e77098c276be3af4bce852e207eb36aa85a08d360d3b7ca2e9cdd","observation_id":"6c8f559a-a488-4514-a855-caf09385a31c","resolution":{"observed_at":"2026-08-03T19:00:14.212980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T19:00:14.217632Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.217632Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:ed16512565a267e0b89c7c54d2b01920ed1fc963513802acd87a11bdd11f47e6","observation_id":"f0eefc44-6918-4e43-af8f-51fbfe797598","resolution":{"observed_at":"2026-08-03T19:00:14.217632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05149","last_updated":"2022-04-11T14:30:27Z","snapshot_observed_at":"2026-08-05T16:48:50.205106Z","submitted_at":"2022-04-11T14:30:27Z","title":"The Carbon Footprint of Machine Learning Training Will Plateau, Then Shrink","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05149","snapshot_observed_at":"2026-08-03T19:00:14.222330Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.222330Z"},"links":{"cited_paper":"/paper/2204.05149","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:eb96c3931f4a1045a689bc8e4d1d7dc209f3915622c2a728fdda92bb81f73e72","observation_id":"4b6671bc-95bf-4dbf-b334-0c54d952f211","resolution":{"observed_at":"2026-08-03T19:00:14.222330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T19:00:14.227681Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.227681Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:7b301a9db615d0331e5e0c9c5bb061a44bf29298b31724dcc3a5cd5549c7fe39","observation_id":"a70055c4-911b-4e85-9fd9-698773862f55","resolution":{"observed_at":"2026-08-03T19:00:14.227681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-03T19:00:14.232768Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.232768Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:c8073bc7aa21f6f77a778202ad60faa1264ab37e2d2182668b77275baff56cdc","observation_id":"94848a43-4df8-41f8-ac64-11928384d117","resolution":{"observed_at":"2026-08-03T19:00:14.232768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.237653Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.237653Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:484fd4e8880f69cd1688e66a0b941a8d482e4b42474dbb3b535bd23115cfc371","observation_id":"aec99eab-c9a6-470a-bb1c-2c1cd879c83b","resolution":{"observed_at":"2026-08-03T19:00:14.237653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.842","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nagendra Kumar","venue":null,"work_id":"121faf13-a409-44b7-99ba-cdcc8e6d3bbb","year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.242874Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:9c31cf99cc8732b8192ab202a4e3ffd7537b0126968167b56f63e9ea2b9d9c55","observation_id":"b94698e2-3058-491c-8d44-e829558f4392","resolution":{"observed_at":"2026-08-03T19:03:33.104627Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/icwsm.v19i1.35894","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the International AAAI Conference on Web and Social Media","work_id":"8bb5f695-e3af-4c07-b725-dc9c1aab1c6a","year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.247759Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:d2ea3f5f87155ae17ac710fc86c008489c937120a0965388bafd75c2cc84f5f5","observation_id":"5199e137-edf2-4015-a37f-17418a9fee98","resolution":{"observed_at":"2026-08-03T19:03:32.994181Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.253091Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.253091Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:9a3936ee32fd3739d99dc66a7191847376874425de3332fcd63751653eae2236","observation_id":"b477492a-e4b8-42e5-ab52-8216877ebc9d","resolution":{"observed_at":"2026-08-03T19:00:14.253091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.259361Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.259361Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:cf7c7d5c12e2985d0bbabe46fdb901db5be6e6c42dfbeadb10ee6744f52a5ce4","observation_id":"c44513e8-cccf-4fbd-9863-5c77e78b7b1d","resolution":{"observed_at":"2026-08-03T19:00:14.259361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.265473Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.265473Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:5dc6239f7412ba121aaad979c228472da5c9185b9c59a4c05a901d9e1441d1db","observation_id":"b2e25163-d713-4276-aac7-10a551cba1aa","resolution":{"observed_at":"2026-08-03T19:00:14.265473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.270912Z","title":"Zico Kolter, Louis-Philippe Morency, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.270912Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:9b750af7982269d557684d96fbc7561dc805077ba0aa88bf3e2ca80dc2755938","observation_id":"6cfd7bca-bed3-49b9-99b2-cf1448f7ef33","resolution":{"observed_at":"2026-08-03T19:00:14.270912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/info12010005","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Information","work_id":"6651f726-4582-496d-a1e9-893722e4b69c","year":2021},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.276520Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:60d7baeebc254968d40b0ef62f261f38e408b07f877b515fab733919d7b2a14c","observation_id":"956c1307-8a3b-4272-b695-5a8fd2a3a20b","resolution":{"observed_at":"2026-08-03T19:03:32.886142Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.281617Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.281617Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:e7e7408bdb47be1d7642b7f0c8659388301562e60605d06c424ebc7867dd3460","observation_id":"8ccc2e1a-d646-4c46-bbaa-fe43ffa884b9","resolution":{"observed_at":"2026-08-03T19:00:14.281617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.286212Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.286212Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:f784dc6da364075bc1ac09e695a8bf92b79c4ffcf0ee8443f382835f44949579","observation_id":"633b37a7-74a9-40ce-a5a3-25dab4313410","resolution":{"observed_at":"2026-08-03T19:00:14.286212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.291872Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.291872Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:a0346a385168e7927a43faff1f794928cc41e62ffede2d79a8b2570a3b8571b7","observation_id":"9718e784-91af-4dda-8f87-132c30b7fa8f","resolution":{"observed_at":"2026-08-03T19:00:14.291872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.296185Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.296185Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:8c2c01149057e0bd3859857e4e6f43c07f4608dd1da0b7c84771a916ec900087","observation_id":"a8447483-9a10-4bc5-82c1-32b9f8a19b85","resolution":{"observed_at":"2026-08-03T19:00:14.296185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.301395Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.301395Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:f3ab97cf46028d737fa38593ac4e92137d3324bfbc27dbd8142bc63c5e2ab3e9","observation_id":"ea83261d-681a-450b-b506-1ec3010a4f63","resolution":{"observed_at":"2026-08-03T19:00:14.301395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.305848Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.305848Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:d6698107b883cb21585647e9c210fc902aed80cb311c2aa20fc233c2880522b9","observation_id":"524df4af-b1b9-4d25-816e-305feca19c16","resolution":{"observed_at":"2026-08-03T19:00:14.305848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.310613Z","title":"The placeholder{text}is replaced by the raw transcript. The model therefore performs binary classification in a strict zero-shot setting and must output exactly “1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.310613Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:26f9f5213da12360d92cfa03194268661a989c4c9745d20990060e7b349bcbb6","observation_id":"c4df42ec-5157-4c1f-abbb-a675b894f0e7","resolution":{"observed_at":"2026-08-03T19:00:14.310613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:00:14.099379Z","title":"Internet Technol.20, 2, Article 10 (March 2020), 22 pages","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.099379Z"},"links":{"citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:13ee4f05403ac22cc196fcbb597749519b980d9018938f11ea577c0512e7afeb","observation_id":"05c30e1e-4529-44a2-aa96-cc4d3c21b48b","resolution":{"observed_at":"2026-08-03T19:00:14.099379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10653","last_updated":"2024-01-19T11:59:13Z","snapshot_observed_at":"2026-07-06T17:17:52.174927Z","submitted_at":"2024-01-19T11:59:13Z","title":"Attentive Fusion: A Transformer-based Approach to Multimodal Hate Speech Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10653","snapshot_observed_at":"2026-08-03T19:00:14.193684Z","title":"arXiv:2401.10653 [cs.CL] https://arxiv.org/abs/2401.10653","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:14.193684Z"},"links":{"cited_paper":"/paper/2401.10653","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:cd095b93d3e249cfd320bb3355267680131f45c0b4bc56d3ca24278985e015ca","observation_id":"16bf02f3-1e60-4ad3-b0a7-85b831a5968e","resolution":{"observed_at":"2026-08-03T19:00:14.193684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:40:25.686537Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2512.02743."}