Worth installing
482
chiennv2000/orthrus
Fast, lossless LLM inference via dual-view diffusion decoding.
diffusion-language-modelsefficient-inferencelarge-language-modelsllmllm-efficiencymodel-architecture+1 more
—
—
Explore 2 GitHub repositories focused on efficient-inference. Discover top-starred projects and those trending this week.
Fast, lossless LLM inference via dual-view diffusion decoding.
[ICML 2024] LLMCompiler: An LLM Compiler for Parallel Function Calling
[ICML 2024] LLMCompiler: An LLM Compiler for Parallel Function Calling
Fast, lossless LLM inference via dual-view diffusion decoding.