{"as_of":"2026-08-16T20:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e3e769847fc22e4fad1ac6213a05b2c905f08b6daabab549fb4903c1ee32c8f","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:09:02.838531Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.09317/citation-record","integrity":"/paper/2412.09317/integrity","json":"/paper/2412.09317/citation-record.json","paper":"/paper/2412.09317"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.986543Z","title":null,"venue":null,"work_id":"666c9fdf-479e-4f10-82b2-2bd75f06fa27","year":2022},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.558401Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:5dedef2a92445e7b71612ae392f68756f28cb0a2a2c72b7b7cd7b0bd8aecbac1","observation_id":"246b9f57-c2f6-4dd1-8a33-fabd2df39bf1","resolution":{"observed_at":"2026-08-11T17:09:13.990176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.974132Z","title":null,"venue":null,"work_id":"063be6c9-886c-4c95-bd00-75281f0ece69","year":2020},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.637304Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:4ea01db0383438636f7c7fca4a996877f25a383538c2135d2846d33ac5f08813","observation_id":"3395a590-bd6b-44ea-8148-4c7598f9f8c9","resolution":{"observed_at":"2026-08-11T17:09:13.978500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.961914Z","title":null,"venue":null,"work_id":"48efa540-6a2d-4f99-8d57-455f7dda012f","year":2016},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.642327Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:10f2ac68b4bcc57d0ad7b8dc08a3c8b22eca129c628c18e69361cba9d3483980","observation_id":"3ae24148-dbb6-47f5-a388-f293d598c595","resolution":{"observed_at":"2026-08-11T17:09:13.966507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.949154Z","title":"A., Yousef, A","venue":null,"work_id":"489f8370-99a8-417a-aae9-41d4de68a557","year":2021},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.647001Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:ecf98bbdd8edf7ec554e87f7fb2e0c7ab7b5c1319eb51aaaa54911b2ce7fd899","observation_id":"8b065e1a-9059-4f9d-8fe5-a5fb379bf294","resolution":{"observed_at":"2026-08-11T17:09:13.953733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.938147Z","title":null,"venue":null,"work_id":"703e6c31-3841-4135-ba15-15066ae80ffe","year":2023},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.651738Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:851444f23a46040769ed155f994c162339c12024eaac9ff8df8ea3230b0ec6bb","observation_id":"92ec4946-1104-4e93-80be-8bb0d5d18cb3","resolution":{"observed_at":"2026-08-11T17:09:13.941953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.926578Z","title":"(2021, October)","venue":null,"work_id":"98699196-e3f3-4e1c-93f3-28d8c6c5c0ef","year":2021},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.655711Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:5de469bb487fbee91694f7e700739f7531bcc34244eba243e01750eb7b8f4241","observation_id":"0fbd8ec5-6733-49b8-8c52-69624fd6d4fb","resolution":{"observed_at":"2026-08-11T17:09:13.930926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.748474Z","title":null,"venue":null,"work_id":"ebe4a589-5bbe-4dc5-b594-c8d1c7dd9b82","year":2014},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.661293Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:f3174d2f87ba5fe7d526763617ccd53785a9382429c84bb3ac097d058f441e7d","observation_id":"a63607ef-5a51-4c69-82ee-1186f6059392","resolution":{"observed_at":"2026-08-11T17:09:13.752616Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:02.665538Z","title":"R., & Russo, F","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.665538Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:7fde88635a62889b27b0fddce6bc1aa68af7142222787c2d2f9a975a1386d8dd","observation_id":"c73aa761-47a5-4f60-8542-fb74d31c4a4f","resolution":{"observed_at":"2026-08-11T17:09:02.665538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.913586Z","title":null,"venue":null,"work_id":"63629aa4-6f06-4fa8-abf3-d923b5b53cdc","year":2020},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.670399Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:08468a8e383f881bf00c63530312d3fe45c9724e37d6a10f42404b7dc3ae2611","observation_id":"ca873164-7301-45ea-8975-c8536349e199","resolution":{"observed_at":"2026-08-11T17:09:13.917352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.901933Z","title":null,"venue":null,"work_id":"db7d8d21-41d5-458b-ab4a-b0502c85521a","year":2021},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.675591Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:161170bb5bb1d7da57525bd38b231e20d7bc31e157a7b98026045dfe64e57789","observation_id":"1e3419d2-fa36-4390-80ca-03de91af5750","resolution":{"observed_at":"2026-08-11T17:09:13.906336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.889441Z","title":"& Chintala, S","venue":null,"work_id":"5f17dfdb-6962-4ef4-a87c-c4be30ed70ba","year":2019},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.679592Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:d82b319c43040268d27ecc8a563c9fc991a33488ddb08e0a8728188be8b639e7","observation_id":"7cf80a15-ecd5-4473-9ebf-fcb7fcb621de","resolution":{"observed_at":"2026-08-11T17:09:13.893794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.877246Z","title":"P., McVicar, M., Battenberg, E., & Nieto, O","venue":null,"work_id":"ebc1176a-7a5c-4b9d-adf1-f2188535119a","year":2015},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.683847Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:2fcc91f9c188cad503770086d2d4db74dcef24eb97029b61f7347d714d1dbe85","observation_id":"abbf4446-ce2f-4b03-a1e8-b3a415648678","resolution":{"observed_at":"2026-08-11T17:09:13.881285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:02.690719Z","title":"& Rush, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.690719Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:f0f00f0395140ead3f9e6729f351e02b7581147ac2b8951c735ed4b0cdaf2a25","observation_id":"62be6ffc-f002-4bce-8f18-7f5a60ac07cf","resolution":{"observed_at":"2026-08-11T17:09:02.690719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.02846","last_updated":"2021-09-07T03:59:22Z","snapshot_observed_at":"2026-08-16T17:58:25.845387Z","submitted_at":"2021-09-07T03:59:22Z","title":"Datasets: A Community Library for Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.02846","snapshot_observed_at":"2026-08-11T17:09:02.694773Z","title":"V ., Jernite, Y ., Thakur, A., von Platen, P., Patil, S.,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.694773Z"},"links":{"cited_paper":"/paper/2109.02846","citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:0b7f4b2eff762d1d34786aa977a0726b522703915d67eead75e8beaf760ef52b","observation_id":"a35190b0-bf25-4026-a574-2bb2e90f4901","resolution":{"observed_at":"2026-08-11T17:09:02.694773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.865364Z","title":"& Duchesnay, ´E","venue":null,"work_id":"0226d9ea-04f9-4ef3-b074-4d75acc60625","year":2011},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.699644Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:6643012c32cc8a8327d3734f56781434daa0890e81791acd7fb8ef52e426ff16","observation_id":"d6c36d5c-3b9a-4141-a75d-9c022782fb18","resolution":{"observed_at":"2026-08-11T17:09:13.869417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.853863Z","title":"& Zheng, X","venue":null,"work_id":"9ffbb435-cc13-4494-b6ad-5a2c7b9b2c67","year":2016},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.704429Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:13d3264c02aa816086ec7e5ee3a9a04ddf411eebc83f0f0744455c7373549205","observation_id":"eac53ab2-860d-4850-a728-a0633dfd8763","resolution":{"observed_at":"2026-08-11T17:09:13.857581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.841979Z","title":"T., Shambrook, B., Van der Wel, C.,","venue":null,"work_id":"d27dc998-ce76-4802-8bd5-fb0585e48917","year":2017},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.708137Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:f3c41e3d7f5389b273552bbf4b64cfe962201abdc39d3d45fabb1bf530374129","observation_id":"432fb31f-bb7e-4dd8-85cb-3386bfe3abf9","resolution":{"observed_at":"2026-08-11T17:09:13.846143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.3551211","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:02.867803Z","title":"K., Altendorf, K., Mary, H., Sheridan, R., Korobov, M.,","venue":null,"work_id":"20107df3-5c68-4877-b29d-381a10550b5c","year":2024},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.770637Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:4b645f5ab4db11e92dda5456ef7dce76d7b3ae4dcff9277fa1be681b0d268a23","observation_id":"8300c4a0-f966-4e16-a309-f0a1217e107a","resolution":{"observed_at":"2026-08-11T17:09:02.875149Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.829443Z","title":null,"venue":null,"work_id":"bba193dc-de70-499a-860e-0624edfd30f6","year":2019},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.776336Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:bef0d6daec14637c052c0fe21f32488db715c99975ea09d3a5b45f7855095e5e","observation_id":"cf809997-1fb6-4f46-888b-9649e5984f6a","resolution":{"observed_at":"2026-08-11T17:09:13.834155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17864","last_updated":"2023-10-27T03:00:51Z","snapshot_observed_at":"2026-08-16T14:48:25.227361Z","submitted_at":"2023-10-27T03:00:51Z","title":"TorchAudio 2.1: Advancing speech recognition, self-supervised learning, and audio processing components for PyTorch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17864","snapshot_observed_at":"2026-08-11T17:09:02.782671Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.782671Z"},"links":{"cited_paper":"/paper/2310.17864","citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:d886e489dc83634a6a571600a2380e7b658e81f79a3b1b5e6c16d135d46c24e1","observation_id":"543b3023-9d7b-475d-bb01-d5c2139bf8de","resolution":{"observed_at":"2026-08-11T17:09:02.782671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15018","last_updated":"2022-02-16T17:48:42Z","snapshot_observed_at":"2026-08-16T17:45:47.248958Z","submitted_at":"2021-10-28T10:58:22Z","title":"TorchAudio: Building Blocks for Audio and Speech Processing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15018","snapshot_observed_at":"2026-08-11T17:09:02.791458Z","title":"Z., Lian, J., Mahadeokar, J., Hwang, J., Chen, J., Goldsborough, P., Roy, P., Narenthiran, S., Watanabe, S., Chintala, S., Quenneville-B´elair, V ., & Shi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.791458Z"},"links":{"cited_paper":"/paper/2110.15018","citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:7ebcc2facecb5c0f51ddce7e7e0c0f9d8e1bce6dad79986d18d9ddccefa506e6","observation_id":"36d6ccbf-6c33-4e4d-addf-8dcba73be9a5","resolution":{"observed_at":"2026-08-11T17:09:02.791458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.817798Z","title":null,"venue":null,"work_id":"827e6e43-9b03-4c07-a343-34339ba27cfd","year":2024},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.807646Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:559167be59dc0f0f0e1e53636f66938fc4597c4ce52cdb70ad084c97e3ee91d5","observation_id":"9893a795-be6c-4ca6-b659-cf3c6f86a646","resolution":{"observed_at":"2026-08-11T17:09:13.821225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.803871Z","title":"(2nd of May, 2024)","venue":null,"work_id":"c63aff3c-a339-4a05-8615-eab63c429ed8","year":2024},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.824495Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:51d27d83da147417105f9c86ca687cce12ea6214981e4f18e0976f27640ccbf9","observation_id":"cbef24fc-31e4-4c37-a69f-f29dd379eb7c","resolution":{"observed_at":"2026-08-11T17:09:13.809316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.789454Z","title":"(2nd of May, 2024)","venue":null,"work_id":"86ec6bb5-1c23-4932-9a60-aeba242f3fe1","year":2024},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.829324Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:aa4f8c721ce1e9f1765be01c5431e491a7a074517198ce79e417934d3f7a8f3b","observation_id":"bee3239f-c5f5-47d6-95b0-48d06ed29c0e","resolution":{"observed_at":"2026-08-11T17:09:13.793870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.774158Z","title":"(2nd of May, 2024)","venue":null,"work_id":"20280105-349d-431e-875d-3ba092e87994","year":2024},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.834142Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:0570b86c8c68bb1fbf3a47ed71e52f60442dab30fce807134759f052ef166390","observation_id":"bebb4b9a-88b8-47b8-9e64-5ae30e378dbe","resolution":{"observed_at":"2026-08-11T17:09:13.779000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:09:13.762272Z","title":"(2nd of May, 2024)","venue":null,"work_id":"1d5e7a7a-e061-45ff-9515-cefdf2ffa653","year":2024},"citing_paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:09:02.838531Z"},"links":{"citing_paper":"/paper/2412.09317"},"observation_digest":"sha256:44ec7c47eb7c5d9e660fc7d8fcc4e74d0bed4b6197421cbd3ea565ee0a7900a5","observation_id":"8c30a0fe-2562-4964-b359-69a52f15c7a2","resolution":{"observed_at":"2026-08-11T17:09:13.766316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09317","last_updated":"2024-12-12T14:42:10Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T13:58:30.973237Z","submitted_at":"2024-12-12T14:42:10Z","title":"Multimodal Sentiment Analysis based on Video and Audio Inputs"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2412.09317."}