{"as_of":"2026-08-09T12:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45582bd035676c2fe01ba89c599848efff49c5aecdc7e1bdf12ddda2fdb10a6d","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:18:32.900270Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:42:33.784811Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T06:41:37.028986Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03722","snapshot_observed_at":"2026-08-06T11:42:33.784811Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03728","last_updated":"2025-07-30T07:51:42Z","snapshot_observed_at":"2026-08-06T11:42:27.212497Z","submitted_at":"2025-07-30T07:51:42Z","title":"WINELL: Wikipedia Never-Ending Updating with LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:42:33.784811Z"},"links":{"cited_paper":"/paper/2508.03722","citing_paper":"/paper/2508.03728"},"observation_digest":"sha256:324cfbc896995ac36dd4ad21206b179d98e93806a7c2f76a0eefbdf1143c3a8e","observation_id":"6a5087e3-3222-4fec-a5e0-b7b40d215aa8","resolution":{"observed_at":"2026-08-06T11:42:33.784811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"cited_work":{"arxiv_id":"2508.03722","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.03722","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","venue":null,"work_id":"8395c3df-ed9f-45fa-b19f-ffb635833b1b","year":2025},"citing_paper":{"arxiv_id":"2605.10404","last_updated":"2026-05-11T11:42:43Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:42:43Z","title":"Position: Life-Logging Video Streams Make the Privacy-Utility Trade-off Inevitable","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T04:03:38.659547Z"},"links":{"cited_paper":"/paper/2508.03722","citing_paper":"/paper/2605.10404"},"observation_digest":"sha256:33a8106ed60256bd6c14919385fe92fa5237601cd10abcd7e5b2268e6ecaf1e1","observation_id":"4134853e-9692-4730-a6db-6da003818775","resolution":{"observed_at":"2026-05-12T06:41:37.038342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.03722/citation-record","integrity":"/paper/2508.03722/integrity","json":"/paper/2508.03722/citation-record.json","paper":"/paper/2508.03722"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T12:18:29.677235Z","title":"Deepseek-r1: Incen- tivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.677235Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:da429d3ba88a668e0307ac31db075951736f7a4c67dd0ae9ebaf126c24552787","observation_id":"8d5c627a-a6db-43ee-a226-5bb0c96c6d11","resolution":{"observed_at":"2026-08-06T12:18:29.677235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T12:18:29.724352Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.724352Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:267be7734ad5e3a1469c525be9c6ea10b682fbedbb8e402779dcace5ce275a7c","observation_id":"4eb8c3b6-26c8-493a-b570-d4b6c0db845e","resolution":{"observed_at":"2026-08-06T12:18:29.724352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:29.763895Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.763895Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:e2ea8fa65882c5e724eb1f423bc94020e1a8cbeef66d2f061f164b373e90c8d4","observation_id":"efd91f36-55f8-451b-912c-67610fb9ae5e","resolution":{"observed_at":"2026-08-06T12:18:29.763895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.941566Z","title":"Train- ing language models to follow instructions with human feedback","venue":null,"work_id":"44616b7a-35a0-46b9-a062-296fa4c0dcd2","year":2022},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.858380Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:ab3e9f81f4d20e65af95c7db6967374be7a7884341a1c50e1e79c01939e4c745","observation_id":"23b59b22-e7a1-4a78-8c88-f34c8c64a3e5","resolution":{"observed_at":"2026-08-06T12:18:38.079998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T12:18:29.911747Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.911747Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:dd1c7ff3c9e22f528bf146f7a7beb8f4a663403a8499561c81c2f5961a70703b","observation_id":"8206c12d-31a4-40cd-8a65-113b73225169","resolution":{"observed_at":"2026-08-06T12:18:29.911747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.18552","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:33.684576Z","title":"R., Shravan Venkatraman, Vigya Sharma, Santhosh Malarvannan, and Modigari Narendra","venue":null,"work_id":"27001004-a457-4abf-848d-f9ac4e031688","year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:29.965395Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:73e82bfc03dfd445fe6c5437de4617fc942ae943cfcbc94791ed06cb8c72bdab","observation_id":"407afac2-5f17-40be-adcf-141bf72293d0","resolution":{"observed_at":"2026-08-06T12:18:33.807166Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.712013Z","title":"Tacfn: Transformer-based adaptive cross-modal fusion network for multimodal emotion recognition.Artificial Intelligence Research, 2, 2023","venue":null,"work_id":"67a755fc-76cf-4269-8e85-f221f736af9d","year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.052923Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:0498211cd62db8de94b0c0f83f52427198719f21c7bf20d21ede5914a46c0e2e","observation_id":"8bee82be-d806-41f9-a2a2-d50e6b8b2026","resolution":{"observed_at":"2026-08-06T12:18:37.820936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.508201Z","title":"Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph","venue":null,"work_id":"a7e2d439-504e-4fc6-b2fd-5200627d7ef1","year":2018},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.152705Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:ff768f2bf47559436868cc6cd290d1c06439547f01c5add255d114c0605c2ff7","observation_id":"74b3c003-b1f4-4aff-bef3-b35b768feb6d","resolution":{"observed_at":"2026-08-06T12:18:37.576873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.268636Z","title":"Livingstone and Frank A","venue":null,"work_id":"1c53e230-ae98-4442-8672-1e12ad723acd","year":2018},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.207137Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:baa6aa387dc23503210d3efb15554cb0cccc7fed4af7f2f36a50e42c742db5c1","observation_id":"08dc0430-9e1c-4952-8d6f-886f58d8298d","resolution":{"observed_at":"2026-08-06T12:18:37.377872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:37.052131Z","title":"Multimodal emotion recognition with vision–language prompting and modality dropout","venue":null,"work_id":"2d77deb3-a9c3-49c1-a65c-1ecc386ac3ab","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.303597Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:29d3c15464e333cc64ee22b790b395dc7621b3dac1d86038255c0a20d5714bf8","observation_id":"23f35a65-b2f2-4331-855f-2cd9752c836f","resolution":{"observed_at":"2026-08-06T12:18:37.178312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:36.838095Z","title":"Visual and textual prompts for enhancing emotion recognition in video","venue":null,"work_id":"8cc6ed6c-7c0b-432d-afd7-4166541062b0","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.454122Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:a81f115d8e2c511c4eb172796c2422edde2f238f4516a2f158f93405e98077d8","observation_id":"fd14d689-c8ec-4d1b-81ad-326227f8d045","resolution":{"observed_at":"2026-08-06T12:18:36.927739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:36.580381Z","title":"Ov-mer: Towards open-vocabulary multi- modal emotion recognition","venue":null,"work_id":"bd93c892-ca3c-495b-bbff-1108fd01c2e3","year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.544722Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:e0f4588eca3ebba22288d1222883bc95b414d1f6990b218697785ffd43048c22","observation_id":"0b3c981a-614c-4c59-b32c-700f34dd850d","resolution":{"observed_at":"2026-08-06T12:18:36.718680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:36.361999Z","title":"Af- fectgpt: A new dataset, model, and benchmark for emotion understanding with multimodal large language models","venue":null,"work_id":"93571de6-963d-4000-9443-75b109967480","year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.634240Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:74319ae5c0ced961c14088215365eadb69313bfb0eea0c6a62bbaf71ce73bcbd","observation_id":"4645c05e-13d6-4053-a3ff-b54cca8f6139","resolution":{"observed_at":"2026-08-06T12:18:36.453411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T12:18:30.733821Z","title":"From sys- tem 1 to system 2: A survey of reasoning large language models.arXiv preprint arXiv:2502.17419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.733821Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:4ce7811b48b0551e8a5d36a31959797708637b691c6bd100a3da467be7fe4651","observation_id":"5e7e6434-b61d-4182-b307-d66b066735de","resolution":{"observed_at":"2026-08-06T12:18:30.733821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T12:18:30.801571Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.801571Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:6d7735e62195efdef36165248522998b8b999afb69050e2f03c7015bcd0c573f","observation_id":"ec32d509-c19c-43eb-a525-ecec7b3af040","resolution":{"observed_at":"2026-08-06T12:18:30.801571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11559","last_updated":"2022-11-18T18:50:09Z","snapshot_observed_at":"2026-08-05T09:04:05.570299Z","submitted_at":"2022-11-18T18:50:09Z","title":"Visual Programming: Compositional visual reasoning without training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11559","snapshot_observed_at":"2026-08-06T12:18:30.875408Z","title":"Visual programming: Compositional visual reasoning without training.arXiv preprint arXiv:2211.11559, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.875408Z"},"links":{"cited_paper":"/paper/2211.11559","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:0980e7ea02d7cc56806e2322087b9d083c0e3c7ff1a0d4c99af55f3b0be63863","observation_id":"acbf79e9-a453-445c-81e2-2cf1ccce4be1","resolution":{"observed_at":"2026-08-06T12:18:30.875408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:36.060610Z","title":"Visual chain-of-thought prompting for knowledge- based visual reasoning","venue":null,"work_id":"a9765ea2-58e4-4813-8594-e8e9f21ace0a","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:30.981852Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:612e5cba8b79c96baa869a22c7f4643c61a671b924cd6094c62d4a1ac90ed7c4","observation_id":"d07a0b31-6cee-4585-ba9b-6525e8515787","resolution":{"observed_at":"2026-08-06T12:18:36.189511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13621","last_updated":"2026-04-11T12:20:15Z","snapshot_observed_at":"2026-08-03T03:53:17.677772Z","submitted_at":"2024-06-19T15:17:10Z","title":"LaMI: Augmenting Large Language Models via Late Multi-Image Fusion","version":2},"cited_work":{"arxiv_id":"2406.13621","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13621","snapshot_observed_at":"2026-08-06T12:18:33.283868Z","title":"LaMI: Augmenting Large Language Models via Late Multi-Image Fusion","venue":"cs.CL","work_id":"1fe7f774-373d-4675-8d18-151541af1977","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.138395Z"},"links":{"cited_paper":"/paper/2406.13621","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:6ff24e38fa99cf57eccd0e4f6164450d1577010f09be4108ef99b4471dfb7712","observation_id":"d99ad617-03b0-4534-a7ea-5f6a91e237b6","resolution":{"observed_at":"2026-08-06T12:18:33.354038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.812775Z","title":"An explainable vision question answer model via diffusion chain-of-thought","venue":null,"work_id":"b5013e00-e0b2-472d-8455-a3b9675cab44","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.263848Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:aeec8e797c9bcfda6efac733c9191c2d421b1b38e30f2be6d6c57d25dbd79b56","observation_id":"5f6af8b3-4203-4346-9353-5555f5361ecf","resolution":{"observed_at":"2026-08-06T12:18:35.886744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.535598Z","title":"The relation between valence and arousal in subjective experience.Psychological bulletin, 139(4):917, 2013","venue":null,"work_id":"c6e03380-5a18-4039-a543-4988f58da008","year":2013},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.418101Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:4badcd5f8d828c46b93dc19c8462bba02d194b5a7c5ac5bbb73cc5032347f993","observation_id":"12e8b7a5-2f19-4031-b883-ac4889c056a2","resolution":{"observed_at":"2026-08-06T12:18:35.691694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.231634Z","title":"Arousal, valence, and mem- ory for detail.Memory, 12(2):237–247, 2004","venue":null,"work_id":"887e8b0c-c632-4866-90eb-be4058da2b1c","year":2004},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.562616Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:6412858d1add62aaa650c1550d7381dd4866845c8b1785fe1f3c76d38df93f01","observation_id":"7ac25b27-2593-4994-b885-9b9f2105ae1d","resolution":{"observed_at":"2026-08-06T12:18:35.369149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.960017Z","title":"Facial action coding system.Environmental Psychology & Nonverbal Behavior, 1978","venue":null,"work_id":"87b10e49-6060-4697-9208-b1581e2d31a7","year":1978},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.689631Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:b774aa4dd6f6f8e83461b54e6c16a2aa9eeb419b96862f5efb264e1595f18f1b","observation_id":"d515ee12-2acc-4932-a8b1-c7eca222a843","resolution":{"observed_at":"2026-08-06T12:18:35.089526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T12:18:31.822763Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.822763Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:2954b4a5ef3dd0068643441bc32982af385a8b1734166275fea05e7a114da8ba","observation_id":"883dd76c-e4e3-45f0-9bf0-fd9b040bdf6b","resolution":{"observed_at":"2026-08-06T12:18:31.822763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T12:18:31.888109Z","title":"Representation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.888109Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:2d6b08bedd843bba7129e9dcff80fce7a60977ce78422b745a83e4d392caae90","observation_id":"540bedeb-187a-448c-9dfc-dcadab01b2d4","resolution":{"observed_at":"2026-08-06T12:18:31.888109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.746884Z","title":"Balanced contrastive learning for long-tailed visual recognition","venue":null,"work_id":"cd15e1ec-9bf2-4652-be0b-da9b6edc7c52","year":2022},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.962363Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:12b2662469acb52a1cfe5b7ff47f241f2c4c6e39d5f7231f8868ab704f621271","observation_id":"9a883165-e486-469f-bb15-7a22a935a461","resolution":{"observed_at":"2026-08-06T12:18:34.829391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.481920Z","title":"Mer 2024: Semi-supervised learning, noise robustness, and open-vocabulary multimodal emotion recognition","venue":null,"work_id":"e8af1bdb-b63e-436b-9a8d-fab9a7395cba","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.057053Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:340f9e76e3fa12e9052692603d4cdc7967a30a3b4cb19c25b53b9c5859155a6c","observation_id":"361c99b7-16e4-41ab-86b2-ed2c3d85bde2","resolution":{"observed_at":"2026-08-06T12:18:34.614285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.186822Z","title":"Mer 2023: Multi-label learning, modality robustness, and semi-supervised learning","venue":null,"work_id":"010fe1c3-b97e-4b09-a83f-d2d84f3deaf6","year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.202923Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:3f517194a9899a2095192a426e176d0cf4353f96069f98f2e4ee7239dbd44d13","observation_id":"c71cc0df-bb19-4809-950a-07bf92d0baa4","resolution":{"observed_at":"2026-08-06T12:18:34.325330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.008941Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning.Advances in Neural Information Processing Systems, 37:110805–110853, 2024","venue":null,"work_id":"f580f516-7fd4-4717-8cad-bf34871cdf24","year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.357879Z"},"links":{"citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:4297e95c18272dc8fd6fd03bd761cc210a198003ee4beda9660494314db63699","observation_id":"9d69c8ff-0d2c-4ea8-93f5-18dd6cb9654c","resolution":{"observed_at":"2026-08-06T12:18:34.070365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T12:18:32.448054Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.448054Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:f0e0ce847e07766ae5275055530bffa832ff336c312bf320a75d9e18d7e6198f","observation_id":"aa515d7c-71c5-416b-a031-6d593afef563","resolution":{"observed_at":"2026-08-06T12:18:32.448054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T12:18:32.553102Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.553102Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:fffb7c3a2dcde70a494e4ebb491975e84092ee30fb1f51f82110914bba1e72d6","observation_id":"7ef91280-3fa7-4007-aa6a-39f50dfe993e","resolution":{"observed_at":"2026-08-06T12:18:32.553102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T12:18:32.678085Z","title":"Minigpt-v2:Largelanguagemodelasaunifiedinterfaceforvision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.678085Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:edb340b5d82b2c30f50ed8094a709667a0aaa33b27bdc7db1ec59e51055f0fbf","observation_id":"6c920637-e1db-4474-889f-be9987090f8c","resolution":{"observed_at":"2026-08-06T12:18:32.678085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T12:18:32.811352Z","title":"Video- llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.811352Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:c2270a7041dca00d9296849eb01e667bcac4719311fb60ae0ad7dbea16dc7311","observation_id":"9b8c1a8a-da01-478c-b1a1-083df0888033","resolution":{"observed_at":"2026-08-06T12:18:32.811352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T12:18:32.900270Z","title":"Video-llama: An instruction-tuned audio- visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.900270Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:3c8f42ec158eedbf6e7b2424a8769c149176ac20982e0836627d10ab50cc8be7","observation_id":"1f53d9fd-8034-4b53-97fe-4a5538355a79","resolution":{"observed_at":"2026-08-06T12:18:32.900270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 2 inbound Pith citation observations for arXiv:2508.03722."}