{"as_of":"2026-08-12T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03dac051342c5b6ab80946dc3a359a6aca304fbd47f72b7a80aa9d4535235e2d","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:41:33.390250Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.17292/citation-record","integrity":"/paper/2412.17292/integrity","json":"/paper/2412.17292/citation-record.json","paper":"/paper/2412.17292"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.04777","last_updated":"2024-05-08T02:48:29Z","snapshot_observed_at":"2026-08-12T14:03:16.430643Z","submitted_at":"2024-05-08T02:48:29Z","title":"Empathy Through Multimodality in Conversational Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04777","snapshot_observed_at":"2026-08-11T05:41:32.836243Z","title":"Empathy through mul- timodality in conversational interfaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:32.836243Z"},"links":{"cited_paper":"/paper/2405.04777","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:c19ee80ffebd9f3a81a091ded4429e538cbce3142944d840409087d0b955aefc","observation_id":"10a95dde-38d3-4839-87f4-e1ca93295a73","resolution":{"observed_at":"2026-08-11T05:41:32.836243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.459582Z","title":"Rahmani, and Ramesh Jain","venue":null,"work_id":"7fbe99eb-64ae-45de-ba4e-324271bbe37d","year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:32.842235Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:cd4d94c52f15ea836d963d4c23eb35de0ec086678251cf38a0a1aea5686d9952","observation_id":"5caa6b3b-b711-4899-95df-ed6e1491726d","resolution":{"observed_at":"2026-08-11T05:41:34.464912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T05:41:32.847576Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:32.847576Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:66badd59b1e494016786c07501b9f5eb0d68016acc9afd3a274e0d4b40badb05","observation_id":"85c12ff7-8a16-40da-8665-2e0a3715138a","resolution":{"observed_at":"2026-08-11T05:41:32.847576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.442768Z","title":"Facechat: An emotion-aware face-to-face dialogue framework","venue":null,"work_id":"0adb55a8-7f91-4e29-b5c3-3562b717935b","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.069472Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:f4621324e267f0962f8a42cd293e55938b27919eb79a6ad1b080bec3b5c55b06","observation_id":"97c2493c-aef2-490d-89d0-d52181a4266e","resolution":{"observed_at":"2026-08-11T05:41:34.447857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-11T05:41:33.074736Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.074736Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:d43c5515e1f0a766944ab6b8ba81aac10c3ba0008b99a823473e9d78daed3e8b","observation_id":"bbe1a122-f4fc-4dbc-b32f-0f1a8bd7e0ac","resolution":{"observed_at":"2026-08-11T05:41:33.074736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T05:41:33.080449Z","title":"Com- mon voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.080449Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:ccc9a038a91101ed30f9bc1ba81d0ce3300f41fe9631acb6c21ac1c96141715e","observation_id":"91b55cb7-7ec2-419a-9915-154f9b0191c5","resolution":{"observed_at":"2026-08-11T05:41:33.080449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.425861Z","title":"Non-verbal communication in human social interaction","venue":null,"work_id":"a2196bc1-af5d-49b4-bd34-8d6da22f0032","year":1972},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.086252Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:a077c43cf4d4c312559edfabd99269042c4ec9dfd75fb675011ad6472dcbd2cf","observation_id":"1165a748-2539-49b5-94f8-188866968abd","resolution":{"observed_at":"2026-08-11T05:41:34.430997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T05:41:33.091119Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.091119Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:dc64023c706e1307dc5f99555af44aae327b769a5e088b244ce5fc4733aec6f1","observation_id":"bd8c445e-b357-4cb2-986f-38a17e003b6b","resolution":{"observed_at":"2026-08-11T05:41:33.091119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.409479Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":"09672e77-1cde-4f7b-bc13-774af1455b57","year":2005},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.097389Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:09ac71b81e020473a744ebbe58f37efd7857e8f0a881995e526e8867f720b5c8","observation_id":"5e29f143-3003-4d08-976d-b6ee62fba3f2","resolution":{"observed_at":"2026-08-11T05:41:34.414928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.391594Z","title":"A neural probabilistic language model","venue":null,"work_id":"6cf7f099-a6c9-4bbf-92c1-310be5d7e106","year":2000},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.101838Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:399c25b0c5a891a30602359e40659ef6fc5b2ad658b879f5b1a6800a51b63735","observation_id":"e1fcdb86-810a-40de-8830-5dbe02ddfaca","resolution":{"observed_at":"2026-08-11T05:41:34.397506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.107326Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.107326Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:c6ad89c92bfbf230ca0e22add41f8291618b0f57e1a24c9c9441f44ad60443f0","observation_id":"9a2599c3-1b19-4067-bd61-18105ac3e172","resolution":{"observed_at":"2026-08-11T05:41:33.107326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.112033Z","title":"How far are we from solving the 2d & 3d face alignment problem? (and a dataset of 230,000 3d facial landmarks)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.112033Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:c1af374b4fdbfe798f21061c45e2571306ea12d5ac04760c9326a4c68ee6bfd6","observation_id":"aad6f30a-782c-4647-a182-b26077c14612","resolution":{"observed_at":"2026-08-11T05:41:33.112033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.351926Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset","venue":null,"work_id":"b1e2a034-0220-4245-ab00-36552057a421","year":2014},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.117351Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:ea9132824ebbbe0d21fbb358631dbc8458aac3165630041ae3da940dcb4464fb","observation_id":"fa8681dc-d0c3-4886-8af0-bf68a0f6dc01","resolution":{"observed_at":"2026-08-11T05:41:34.357690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.122541Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.122541Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:6d3ffd54eec74af85ad326e2452c60af5524b79c519d1a518077a0f844eb7cf5","observation_id":"7cf50eda-3079-4e43-8608-02e13d757dec","resolution":{"observed_at":"2026-08-11T05:41:33.122541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-11T05:41:33.127633Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.127633Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:de39f487fbdcfa654acf8ae0a8bb57771cb4c39073dc817bd9d884af14eb6804","observation_id":"24beb63f-628e-4a50-ad59-36a4a5a335d0","resolution":{"observed_at":"2026-08-11T05:41:33.127633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.133408Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.133408Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:49897ab2be5b1f5c0d4bac024e0263d21ca75859b97a4b274beb493b6e7a68a1","observation_id":"a5f0462c-2ba7-41fb-b957-f79247347c4f","resolution":{"observed_at":"2026-08-11T05:41:33.133408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-11T05:41:33.138391Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.138391Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:e53b9283775cdd6f6b7347c7a207b5cdb04a853b966290f0d744c36ba534a0a7","observation_id":"bb900e1d-4d39-45d1-b8c2-4cc399c98be3","resolution":{"observed_at":"2026-08-11T05:41:33.138391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.315460Z","title":"Towards multimodal emotional support con- versation systems, 2024","venue":null,"work_id":"2d743cb6-9d5a-4d4f-8975-6240a4e1755b","year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.143449Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:86d19f7d10c92fd4bde0e724cd186d17933c819a66f859f941d9dec9212fbcd3","observation_id":"053d322a-ba49-424b-86ff-8dbfe45ddf01","resolution":{"observed_at":"2026-08-11T05:41:34.320642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00547","last_updated":"2020-06-03T00:31:11Z","snapshot_observed_at":"2026-07-06T09:16:56.708811Z","submitted_at":"2020-05-01T18:00:02Z","title":"GoEmotions: A Dataset of Fine-Grained Emotions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00547","snapshot_observed_at":"2026-08-11T05:41:33.148396Z","title":"Goemo- tions: A dataset of fine-grained emotions","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.148396Z"},"links":{"cited_paper":"/paper/2005.00547","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:ef3f76d373a162ca7f8ef8add7000cf8e6d88b621a206c9a7b3b622513a47d95","observation_id":"a1aef6e3-e7d0-4f97-8552-90ed59f3653d","resolution":{"observed_at":"2026-08-11T05:41:33.148396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.299237Z","title":"Retinaface: Single-shot multi- level face localisation in the wild","venue":null,"work_id":"3357d3b3-38c3-46d1-9efa-dc3bc558cb58","year":2020},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.153793Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:ebf7abe3a376bca53ad6d1793808591b0928178014e61e8adfd8df708f76dc49","observation_id":"1b9dc277-c2cf-49ef-8775-d2a1dbd601ac","resolution":{"observed_at":"2026-08-11T05:41:34.304532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15177","last_updated":"2024-06-21T14:23:31Z","snapshot_observed_at":"2026-08-10T00:38:12.369488Z","submitted_at":"2024-06-21T14:23:31Z","title":"EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15177","snapshot_observed_at":"2026-08-11T05:41:33.159002Z","title":"Empathyear: An open-source avatar multi- modal empathetic chatbot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.159002Z"},"links":{"cited_paper":"/paper/2406.15177","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:311d90415ee34b6c47311dec4e941eb239bd4b876d7510322e185aaab7fb7e1b","observation_id":"a801b367-aceb-47b3-9db8-eb8a763541c1","resolution":{"observed_at":"2026-08-11T05:41:33.159002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.281314Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"780f03db-e154-4f42-8ab0-852c9fd7a746","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.164662Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:4a66450f907a5c0448f0be0f022aa4b785136637311af2facc7ccb0d620676cb","observation_id":"df1fcccf-4332-4586-9d3c-7e4eceaa3ab8","resolution":{"observed_at":"2026-08-11T05:41:34.287083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T05:41:33.171100Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.171100Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:4f9f1e992a90f030ff21ae74a6752c57915a9bf017ca6e8b942521364e063773","observation_id":"c9633150-aece-4a77-9ed0-9059406c1eb7","resolution":{"observed_at":"2026-08-11T05:41:33.171100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12995","last_updated":"2023-04-25T17:05:38Z","snapshot_observed_at":"2026-08-12T03:22:28.835850Z","submitted_at":"2023-04-25T17:05:38Z","title":"AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12995","snapshot_observed_at":"2026-08-11T05:41:33.176818Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.176818Z"},"links":{"cited_paper":"/paper/2304.12995","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:3bd89e258943ebc66dfec8ac7b780c806c4b883806b91c25778606d81fa8593e","observation_id":"f4f11a56-8622-43b2-9f1f-fe98f6afb096","resolution":{"observed_at":"2026-08-11T05:41:33.176818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.182934Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.182934Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:2c602cf41dc05498f2bd50ea1e60abb085c83e2701ce17628013bc886f597ed6","observation_id":"32dce23d-ac17-4de5-8b3b-99ab082b7ad5","resolution":{"observed_at":"2026-08-11T05:41:33.182934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11248","last_updated":"2024-06-02T17:34:18Z","snapshot_observed_at":"2026-07-06T17:31:33.340510Z","submitted_at":"2024-02-17T11:03:02Z","title":"CoLLaVO: Crayon Large Language and Vision mOdel","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11248","snapshot_observed_at":"2026-08-11T05:41:33.187905Z","title":"Collavo: Crayon large language and vision model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.187905Z"},"links":{"cited_paper":"/paper/2402.11248","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:0b05191a5c927a5bd9136386a0af51c0d52e2efc766e563743c582647ded0ac9","observation_id":"e4b3b818-95d7-4f05-ab8b-ab48d29d055f","resolution":{"observed_at":"2026-08-11T05:41:33.187905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.03055","last_updated":"2016-06-10T22:03:28Z","snapshot_observed_at":"2026-07-06T04:32:42.614338Z","submitted_at":"2015-10-11T14:04:57Z","title":"A Diversity-Promoting Objective Function for Neural Conversation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.03055","snapshot_observed_at":"2026-08-11T05:41:33.193401Z","title":"A diversity-promoting objective func- tion for neural conversation models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.193401Z"},"links":{"cited_paper":"/paper/1510.03055","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:a94cefb4cabd8b85344fcb79c72477ecbfe42b8392718b978b3b75c93404b6f0","observation_id":"49604cd8-84cc-4946-8f70-1c133ee6d42a","resolution":{"observed_at":"2026-08-11T05:41:33.193401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.198727Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.198727Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:01ac3a998aae5c5b16b2962181d1e1eee9e6371814f10450867e3e8a91759300","observation_id":"f49ec87b-b44e-4ce6-98d7-e511d6024f4e","resolution":{"observed_at":"2026-08-11T05:41:33.198727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.242756Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"515ef6c9-8f56-47ce-982c-b39a5d48f1c4","year":2004},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.203694Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:aa737ea30d029dd58690916d6aa0b5b4a20b867b0e62a73bcc62492c27c803f7","observation_id":"ef1bc8fc-ff9a-49cc-9b51-e64d8ca4cce7","resolution":{"observed_at":"2026-08-11T05:41:34.248264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.225778Z","title":"Paralinguistics-enhanced large language modeling of spoken dialogue","venue":null,"work_id":"a0bd9bf3-a3a4-480f-90bd-1994f48b2045","year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.209055Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:d1303afb945255c8bc61f35e10a0e2b13317deb259895e719183a91d429e66c2","observation_id":"8fef244b-6d9e-4e28-ab4a-ecd1e1e3a98a","resolution":{"observed_at":"2026-08-11T05:41:34.231184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.213822Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.213822Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:bb345dee09df73a12593c807cb36cbc72cf3c882cb8f5552a09b7b34b975cc54","observation_id":"141e1eaa-952c-45d7-b268-6b88002b2ca9","resolution":{"observed_at":"2026-08-11T05:41:33.213822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.218859Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.218859Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:29949c60c5bfeffda8743fb6972bccddb73507ffc814b961b050de8ad25d2aca","observation_id":"a010c5e9-99e9-4651-aef4-227a4274d111","resolution":{"observed_at":"2026-08-11T05:41:33.218859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.186810Z","title":"The ryer- son audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english","venue":null,"work_id":"33c73edc-cc3d-4693-9604-bd77feace2ed","year":2018},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.224336Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:a29c9b6369bfa79c3cabae2ea9a20953a129cd5fd9da35aab010888852b79c27","observation_id":"f538aa0b-225b-40f7-ad69-b948551e7fcb","resolution":{"observed_at":"2026-08-11T05:41:34.192672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T05:41:33.229353Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.229353Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:fc7c04a6a38b5c373b9973d8cd0f92019e8d11ebd3bd36b836763e40a1edf291","observation_id":"78d20b3b-01ce-4009-b82c-e1629321318e","resolution":{"observed_at":"2026-08-11T05:41:33.229353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.169077Z","title":"Gen- erative spoken dialogue language modeling","venue":null,"work_id":"904c422a-9343-499c-8a20-9c5322a330d3","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.235122Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:25ba017ba4a3413fce9c9c05a970edaaaaae876424e91790ca5ad1d2124169d1","observation_id":"b5ac3c96-bf86-46e3-aa66-1b9d6e0a142d","resolution":{"observed_at":"2026-08-11T05:41:34.174437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.152090Z","title":"Librispeech: an asr corpus based on public do- main audio books","venue":null,"work_id":"37e845fc-1956-4968-ad58-c81034f3ceb7","year":2015},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.240627Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:43f2d5f5144cc94f7f46e31de7fb2c9dda2df989f09a5875be1e614d08a4e49b","observation_id":"d28c59e3-69d6-4a40-8262-5099d4ed297e","resolution":{"observed_at":"2026-08-11T05:41:34.157323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07867","last_updated":"2024-08-02T15:05:47Z","snapshot_observed_at":"2026-08-11T11:47:10.095640Z","submitted_at":"2024-06-12T04:48:36Z","title":"Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07867","snapshot_observed_at":"2026-08-11T05:41:33.245811Z","title":"Let’s go real talk: Spoken dialogue model for face-to-face conversa- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.245811Z"},"links":{"cited_paper":"/paper/2406.07867","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:400307071c3d5acf8d11ba5860023d56e3c7d4e39222e3998d9d27dd5fb852ef","observation_id":"cd831bb4-08ac-497c-8bc1-5c98edf90e94","resolution":{"observed_at":"2026-08-11T05:41:33.245811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.08771","last_updated":"2018-09-12T14:13:33Z","snapshot_observed_at":"2026-08-10T08:51:09.033778Z","submitted_at":"2018-04-23T22:54:55Z","title":"A Call for Clarity in Reporting BLEU Scores","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.08771","snapshot_observed_at":"2026-08-11T05:41:33.253158Z","title":"A call for clarity in reporting bleu scores","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.253158Z"},"links":{"cited_paper":"/paper/1804.08771","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:dcd97a8d6c5089e0198d06dcb2effd90379060bffd9676b141786ba798f6af61","observation_id":"888f3fa5-ca73-42f2-8aeb-0ca558f1a949","resolution":{"observed_at":"2026-08-11T05:41:33.253158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.259314Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.259314Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:b3d0d5ef97b735788b6101aad79f6e6b6b13176f89c748e83279002cc2503e02","observation_id":"e0bbf93c-7a3d-4862-954e-6e8abc9e4d89","resolution":{"observed_at":"2026-08-11T05:41:33.259314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.125222Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"23a3c99e-fc50-4668-8fdc-44a9044fdb68","year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.264135Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:415413ac639a7ac8d7db6ac4a2e3ae2d6a215a981677155e40f0487a1338cfe5","observation_id":"743ee57f-053e-45ce-b1d1-695af3a57bc1","resolution":{"observed_at":"2026-08-11T05:41:34.131058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.268906Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.268906Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:5bbaf510f9e75ff6ad74dc1a8815ada74cfaa79bc49a05a7fc72641db061fd36","observation_id":"56dcf946-7027-4f02-acaf-3cdb3ed3000d","resolution":{"observed_at":"2026-08-11T05:41:33.268906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.096224Z","title":"Deepface: Closing the gap to human-level per- formance in face verification","venue":null,"work_id":"25ccf4f2-bc7c-402e-95cc-b9b0e32c13f3","year":2014},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.273920Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:6f99facdb16d6883317a01baddfdb3d90f9e5bd4746a4e4fc9b176f838bb4e18","observation_id":"603a6181-8037-4858-8586-39910ee2cfbb","resolution":{"observed_at":"2026-08-11T05:41:34.101671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-11T05:41:33.279337Z","title":"Salmonn: Towards generic hearing abilities for large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.279337Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:da0323186b4ffdc3fd818e031cacdaf3272406f5c33a82707f8fc70f807a330a","observation_id":"0f5ec78b-f67e-4117-a13d-22e74e8b8cf3","resolution":{"observed_at":"2026-08-11T05:41:33.279337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T05:41:33.284458Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.284458Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:8bcea6f792b391486a040895ba45bc094686cfa8b14fd0f1b667b5df23f84350","observation_id":"a93e3875-9208-4627-a1ef-b2b7cd2e37cc","resolution":{"observed_at":"2026-08-11T05:41:33.284458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T05:41:33.289815Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.289815Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:c705e8c519db0121a47a8f1187fb8d2eeb4d4f7d74306d98cdb9785c4e3cb50e","observation_id":"4c6cbd7c-a95e-417c-be6e-c94589a3539c","resolution":{"observed_at":"2026-08-11T05:41:33.289815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.078303Z","title":"Nonverbal cues in human–robot interaction: A communication studies perspec- tive","venue":null,"work_id":"63c0c7a3-509d-471d-b6d6-08c991f72a57","year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.294830Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:4336a51bd3498f25154c6bf3210fb71b6b41df78d09f63052d57b312bcefd1fc","observation_id":"a66f0a91-7e53-451e-9c10-df680246853f","resolution":{"observed_at":"2026-08-11T05:41:34.083757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-11T05:41:33.300088Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.300088Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:2cf0ed348233953cb9e0ecb9813612c342e2b3bf493b8fb97dc88c14b3584630","observation_id":"197bb5ce-6c80-4c14-a1ec-71a2e2db2c3a","resolution":{"observed_at":"2026-08-11T05:41:33.300088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-11T05:41:33.305307Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.305307Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:32d5f4c70a7568542c763383db1b2f04f7a1f58233081957e84ad7e4c52e4b73","observation_id":"ef9e7d27-876e-44ac-8e72-8338b337f9a1","resolution":{"observed_at":"2026-08-11T05:41:33.305307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00475","last_updated":"2024-07-27T07:45:43Z","snapshot_observed_at":"2026-08-11T18:21:48.167715Z","submitted_at":"2023-12-31T12:29:12Z","title":"E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00475","snapshot_observed_at":"2026-08-11T05:41:33.310250Z","title":"E-chat: Emotion-sensitive spoken dialogue system with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.310250Z"},"links":{"cited_paper":"/paper/2401.00475","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:3d9f75cf93071ff684130354bedd8dd7c9d256deded919100a44fd3b34898404","observation_id":"232acf97-afc6-4654-9994-9bd2ff31758a","resolution":{"observed_at":"2026-08-11T05:41:33.310250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-11T05:41:33.316145Z","title":"Speechgpt: Empower- ing large language models with intrinsic cross-modal conver- sational abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.316145Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:826a5eaa9994497b8517e70ba7286d819e9096987e4b838e6ced3b6e2d95502f","observation_id":"992ada81-9b8d-49a7-87fa-bc54fdeb9c55","resolution":{"observed_at":"2026-08-11T05:41:33.316145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T05:41:33.321332Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.321332Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:684d7adcf20b97d8de2e3365666b651bf59209601054b640ebba3c6aa5808e16","observation_id":"8a4ad359-db96-4a07-a166-3948da8617d7","resolution":{"observed_at":"2026-08-11T05:41:33.321332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T05:41:33.326680Z","title":"Opt: Open pre-trained trans- former language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.326680Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:dfece437e98b0961bcad9673eca68a5147d622ae1fef4c2e60c9ca1495014d12","observation_id":"9af723fe-c657-40b5-999e-7fabb25417e7","resolution":{"observed_at":"2026-08-11T05:41:33.326680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-11T05:41:33.332586Z","title":"Bertscore: Evaluating text genera- tion with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.332586Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:020638026217f3d1b453604d465fa2321387c3fb04fbe64c142b190f4708261d","observation_id":"dd18ea5b-f986-47ae-a955-b61271b4d3bf","resolution":{"observed_at":"2026-08-11T05:41:33.332586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00536","last_updated":"2020-05-02T07:09:50Z","snapshot_observed_at":"2026-08-12T12:35:17.076560Z","submitted_at":"2019-11-01T18:16:54Z","title":"DialoGPT: Large-Scale Generative Pre-training for Conversational Response Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00536","snapshot_observed_at":"2026-08-11T05:41:33.337719Z","title":"Dialogpt: Large-scale generative pre-training for conversational response generation","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.337719Z"},"links":{"cited_paper":"/paper/1911.00536","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:1b3e916d9f12d1b15cddccf8fcd2f34e52e87ac0b8cbd2d89c21fb45edc8b33c","observation_id":"6ac453cb-0805-4ce5-9ad7-f2d2d0388e5e","resolution":{"observed_at":"2026-08-11T05:41:33.337719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.060169Z","title":"A higher BLEU score indicates a more natural and engaging dialogue model","venue":null,"work_id":"f603f6d0-3c5a-462e-bb2d-6977886b1388","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.343532Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:f396cd708ea5ea2a6a0777e8c7b6b268003842a66fb99a862ed9685256d5dca8","observation_id":"b02e6bb9-6af8-4011-87e8-2eba579bab59","resolution":{"observed_at":"2026-08-11T05:41:34.065645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.043185Z","title":"Fluency evaluates the grammatical correctness, smoothness, and natural flow of the response","venue":null,"work_id":"b0b0f115-cf41-4cc7-b033-375f0db29b4b","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.348630Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:4b6f6584210ffcfad7bf616ac1ed43bddb8dadfa1d2d31aefdd9180d8ea22653","observation_id":"5ea4968a-f7f4-4369-8911-42d70cb02f94","resolution":{"observed_at":"2026-08-11T05:41:34.049017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.025593Z","title":null,"venue":null,"work_id":"bfbfb5d5-222f-433d-919f-2962bebc370d","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.354052Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:878df29be5c39a031c90fc5ab4abe8a4c7941244189e14194dfb217e80920ef9","observation_id":"fae329b9-1064-4ffa-a20b-f112b6440eed","resolution":{"observed_at":"2026-08-11T05:41:34.030674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:34.007057Z","title":"It con- tains 2,615 hours of English speech from 92,325 voices with diverse genders, ages, and accents","venue":null,"work_id":"588be710-2126-462a-8965-fa1d377d8ea1","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.359058Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:7f0a3747c4b285125f0509b167359c1be41d7c0b83350573c2a82f76b4384438","observation_id":"dbc4d716-2063-4973-b899-f2669da73c0b","resolution":{"observed_at":"2026-08-11T05:41:34.013229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.988912Z","title":"The prompt given to the GPT is: These are the frames in a video","venue":null,"work_id":"45ea0ecb-4f1f-4ece-828a-c829222506cb","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.364317Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:576cac1543eddc4e40386e0a359ef8fb3d448fb19ef79aab9b908c15b69a479d","observation_id":"aa9cfbb6-a444-4f41-9f1c-b09b7e64ca78","resolution":{"observed_at":"2026-08-11T05:41:33.994769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.971703Z","title":"Yeah, I think it’s unfair how the FD burns 6 tons of books","venue":null,"work_id":"62587a22-562b-42ed-8da5-c6a5f827e6a2","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.369504Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:d158e967fb30f5a5ed90120453eef7b9107e145966c12659100a0d7b11d717f9","observation_id":"e7b34924-928c-47b7-a190-3fd516d0764e","resolution":{"observed_at":"2026-08-11T05:41:33.976852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.955683Z","title":"Understanding the context is crucial for a fair evaluation","venue":null,"work_id":"7a57d2e2-40b3-45eb-87fc-82e3655482a4","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.374722Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:af921c464eab3bd50f7b770257ed8bf5c0758fe3524efba6bd6f4c0e76491a5d","observation_id":"cbdd5d48-a78e-4d9c-8bd0-c8f1cc0766b8","resolution":{"observed_at":"2026-08-11T05:41:33.960759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.937816Z","title":"Consider if the emotion expressed is suitable for the situation","venue":null,"work_id":"6c8c0ef5-3cf7-4e38-9130-4c4c2b15db30","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.379738Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:f2e1b9fd7b25bfb44759884a871d38dad95907f78ff21fa09b0000d2e519a433","observation_id":"f59e432a-3a1e-44cd-9012-1442a6576f8b","resolution":{"observed_at":"2026-08-11T05:41:33.943115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.921678Z","title":null,"venue":null,"work_id":"a382a716-a72a-4f12-b9b1-e7a4d238c362","year":null},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.384727Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:5cdc30a6ccecf0516d48e3d20d703c2bc6b1fe7b0aebf23d4e5dbb4439aa19fe","observation_id":"c9647bcc-93cc-485d-a050-452bec147607","resolution":{"observed_at":"2026-08-11T05:41:33.926595Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:41:33.902662Z","title":"I've been feeling really down lately. Nothing seems to cheer me up","venue":null,"work_id":"43aa20d9-b2fd-4817-a5bd-55e784c4db33","year":2003},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.390250Z"},"links":{"citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:79f3b8430f4cc77b4d028b5e7a926e9faf8ec4f20bf4991272ca898e966d55f6","observation_id":"8a3b6a30-15fb-463b-aba8-f6a6c29d223a","resolution":{"observed_at":"2026-08-11T05:41:33.910063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2412.17292."}