Memcached二三事儿

作者：哈哈哈阿笑 | 来源：互联网 | 2018-06-11 02:32

Memcached绝对称得上是NoSQL老兵！可惜随着时间的推移，Redis等后起之秀羽翼渐丰，Memcached相比之下已呈颓势。那我们还用不用学习它？答案是肯定的！毕竟仍然有很多项目依赖着它，如果忽视它，一旦出了问题就只有干瞪眼的份儿了。网络上关于Memcached的资

Memcached绝对称得上是NoSQL老兵！可惜随着时间的推移，Redis等后起之秀羽翼渐丰，Memcached相比之下已呈颓势。那我们还用不用学习它？答案是肯定的！毕竟仍然有很多项目依赖着它，如果忽视它，一旦出了问题就只有干瞪眼的份儿了。

网络上关于Memcached的资料可以说是浩如烟海，其中不乏一些精彩之作，比如说由爱好者翻译的「Memcached全面剖析」系列文章，在中文社区广为流传，虽然已经是几年前的文章了，但是即便现在读起来，依然感觉收获良多，推荐大家多看几遍：

Memcached的基础
理解Memcached的内存存储
Memcached的删除机制和发展方向
Memcached的分布式算法
Memcached的应用和兼容程序

当然，官方Wiki永远是最权威的资料，即便是里面的ReleaseNotes也不要放过。

实际应用Memcached时，我们遇到的很多问题都是因为不了解其内存分配机制所致，下面就让我们以此为开端来开始Memcached之旅吧！

为了规避内存碎片问题，Memcached采用了名为SlabAllocator的内存分配机制。内存以Page为单位来分配，每个Page分给一个特定长度的Slab来使用，每个Slab包含若干个特定长度的Chunk。实际保存数据时，会根据数据的大小选择一个最贴切的Slab，并把数据保存在对应的Chunk中。如果某个Slab没有剩余的Chunk了，系统便会给这个Slab分配一个新的Page以供使用，如果没有Page可用，系统就会触发LRU机制，通过删除冷数据来为新数据腾出空间，这里有一点需要注意的是：LRU不是全局的，而是针对Slab而言的。

一个Slab可以有多个Page，这就好比在古代一个男人可以娶多个女人；一旦一个Page被分给某个Slab后，它便对Slab至死不渝，犹如古代那些贞洁的女人。但是女人的数量毕竟是有限的，所以一旦一些男人娶得多了，必然另一些男人就只剩下咽口水的份儿，这在很大程度上增加了社会的不稳定因素，于是乎我们要解放女性。

好在Memcached已经意识到解放女性的重要性，新版本中Page可以调配给其它的Slab：

shell> memcached -o slab_reassign,slab_automove

换句话说：女人可以改嫁了！这方面，其实Memcached的儿子Twemcache革命得更彻底，他甚至写了一篇大字报，以事实为依据，痛斥老子的无能，有兴趣的可以继续阅读：Random Eviciton vs Slab Automove。

了解Memcached内存使用情况的最佳工具是：Memcached-tool。如果我们发现某个Slab的Evicted不为零，则说明这个Slab已经出现了LRU的情况，这通常是个危险的信号，但也不能一概而论，需要结合Evict_Time来做进一步判断。

&＃8230;

在Memcached的使用过程中，除了会遇到内存分配机制相关的问题，还有很多稀奇古怪的问题等着你呢，下面我选出几个有代表性的问题来逐一说明：

Cache失效后的拥堵问题

通常我们会为两种数据做Cache，一种是热数据，也就是说短时间内有很多人访问的数据；另一种是高成本的数据，也就说查询很很耗时的数据。当这些数据过期的瞬间，如果大量请求同时到达，那么它们会一起请求后端重建Cache，造成拥堵问题，就好象在北京上班做地铁似的，英文称之为：stampeding herd，老外这里的用词还是很形象的。

一般有如下几种解决思路可供选择：

首先，我们可以主动更新Cache。前端程序里不涉及重建Cache的职责，所有相关逻辑都由后端独立的程序（比如CRON脚本）来完成，但此方法并不适应所有的需求。

其次，我们可以通过加锁来解决问题。以PHP为例，伪代码大致如下：

get($key);
    if ($cache->getResultCode() == Memcached::RES_NOTFOUND) {
        if ($cache->add($lockKey, $lockData, $lockExpiration)) {
            $data = $db->query();
            $cache->set($key, $data, $expiration);
            $cache->delete($lockKey);
        } else {
            sleep($interval);
            $data = query();
        }
    }
    return $data;
}
?>

不过这里有一个问题，代码里用到了sleep，也就是说客户端会卡住一段时间，就拿PHP来说吧，即便这段时间非常短暂，也有可能堵塞所有的FPM进程，从而使服务中断。于是又有人想出了柔性过期的解决方案，所谓柔性过期，指的是设置一个相对较长的过期时间，或者干脆不再直接设置数据的过期时间，取而代之的是把真正的过期时间嵌入到数据中去，查询时再判断，如果数据过期就加锁重建，如果加锁失败，不再sleep，而是直接返回旧数据，以PHP为例，伪代码大致如下：

get($key);
    if (isset($data['expiration']) && $data['expiration'] <$now) {
        if ($cache->add($lockKey, $lockData, $lockExpiration)) {
            $data = $db->query();
            $data['expiration'] = $expiration;
            $cache->set($key, $data);
            $cache->delete($lockKey);
        }
    }
    return $data;
}
?>

问题到这里似乎已经圆满解决了，且慢！还有一些特殊情况没有考虑到：设想一下服务重启；或者某个Cache里原本没有的冷数据因为某些情况突然转换成热数据；又或者由于LRU机制导致某些键被意外删除，等等，这些情况都可能会让上面的方法失效，因为在这些情况里就不存在所谓的旧数据，等待用户的将是一个空页面。

好在我们还有Gearman这根救命稻草。当需要更新Cache的时候，我们不再直接查询数据库，而是把任务抛给Gearman来处理，当并发量比较大的时候，Gearman内部的优化可以保证相同的请求只查询一次后端数据库，以PHP为例，伪代码大致如下：

get($key);
    if ($cache->getResultCode() == Memcached::RES_NOTFOUND) {
        $data = $gearman->do($function, $workload, $unique);
        $cache->set($key, $data, $expiration);
    }
    return $data;
}
?>

说明：如果多个并发请求的$unique参数一样，那么实际上Gearman只会请求一次。

Multiget的无底洞问题

Facebook在Memcached的实际应用中，发现了Multiget无底洞问题，具体表现为：出于效率的考虑，很多Memcached应用都已Multiget操作为主，随着访问量的增加，系统负载捉襟见肘，遇到此类问题，直觉通常都是通过增加服务器来提升系统性能，但是在实际操作中却发现问题并不简单，新加的服务器好像被扔到了无底洞里一样毫无效果。

为什么会这样？让我们来模拟一下案发经过，看看到底发生了什么：

我们使用Multiget一次性获取100个键对应的数据，系统最初只有一台Memcached服务器，随着访问量的增加，系统负载捉襟见肘，于是我们又增加了一台Memcached服务器，数据散列到两台服务器上，开始那100个键在两台服务器上各有50个，问题就在这里：原本只要访问一台服务器就能获取的数据，现在要访问两台服务器才能获取，服务器加的越多，需要访问的服务器就越多，所以问题不会改善，甚至还会恶化。

不过，作为被告方，Memcached官方开发人员对此进行了辩护：

请求多台服务器并不是问题的症结，真正的原因在于客户端在请求多台服务器时是并行的还是串行的！问题是很多客户端，包括Libmemcached在内，在处理Multiget多服务器请求时，使用的是串行的方式！也就是说，先请求一台服务器，然后等待响应结果，接着请求另一台，结果导致客户端操作时间累加，请求堆积，性能下降。

如何解决这个棘手的问题呢？只要保证Multiget中的键只出现在一台服务器上即可！比如说用户名字（user:foo:name），用户年龄（user:foo:age）等数据在散列到多台服务器上时，不应按照完整的键名（user:foo:name和user:foo:age）来散列的，而应按照特殊的键（foo）来散列的，这样就保证了相关的键只出现在一台服务器上。以PHP的 Memcached客户端为例，有getMultiByKey和setMultiByKey可供使用。

Nagle和DelayedAcknowledgment的延迟问题

老实说，这个问题和Memcached没有半毛钱关系，任何网络应用都有可能会碰到这个问题，但是鉴于很多人在写Memcached程序的时候会遇到这个问题，所以还是拿出来聊一聊，在这之前我们先来看看Nagle和DelayedAcknowledgment的含义：

先看看Nagle：

假如需要频繁的发送一些小包数据，比如说1个字节，以IPv4为例的话，则每个包都要附带40字节的头，也就是说，总计41个字节的数据里，其中只有1个字节是我们需要的数据。为了解决这个问题，出现了Nagle算法。它规定：如果包的大小满足MSS，那么可以立即发送，否则数据会被放到缓冲区，等到已经发送的包被确认了之后才能继续发送。通过这样的规定，可以降低网络里小包的数量，从而提升网络性能。

再看看DelayedAcknowledgment：

假如需要单独确认每一个包的话，那么网络中将会充斥着无数的ACK，从而降低了网络性能。为了解决这个问题，DelayedAcknowledgment规定：不再针对单个包发送ACK，而是一次确认两个包，或者在发送响应数据的同时捎带着发送ACK，又或者触发超时时间后再发送ACK。通过这样的规定，可以降低网络里ACK的数量，从而提升网络性能。

Nagle和DelayedAcknowledgment虽然都是好心，但是它们在一起的时候却会办坏事。下面我们举例说说Nagle和DelayedAcknowledgment是如何产生延迟问题的：

Nagle和DelayedAcknowledgment的延迟问题

客户端需要向服务端传输数据，传输前数据被分为ABCD四个包，其中ABC三个包的大小都是MSS，而D的大小则小于MSS，交互过程如下：

首先，因为客户端的ABC三个包的大小都是MSS，所以它们可以耗无障碍的发送，服务端由于DelayedAcknowledgment的存在，会把AB两个包放在一起来发送ACK，但是却不会单独为C包发送ACK。

接着，因为客户端的D包小于MSS，并且C包尚未被确认，所以D包不会立即发送，而被放到缓冲区里延迟发送。

最后，服务端触发了超时阈值，终于为C包发送了ACK，因为不存在未被确认的包了，所以即便D包小于MSS，也总算熬出头了，可以发送了，服务端在收到了所有的包之后就可以发送响应数据了。

说到这里，假如你认为自己已经理解了这个问题的来龙去脉，那么我们尝试改变一下前提条件：传输前数据被分为ABCDE五个包，其中ABCD四个包的大小都是MSS，而E的大小则小于MSS。换句话说，满足MSS的完整包的个数是偶数个，而不是前面所说的奇数个，此时又会出现什么情况呢？答案我就不说了，留给大家自己思考。

知道了问题的原委，解决起来就简单了：我们只要设置socket选项为TCP_NODELAY即可，这样就可以禁用Nagle，以PHP为例：

setOption(Memcached::OPT_TCP_NODELAY, true);
?>

如果大家意犹未尽，可以继续浏览：TCP Performance problems caused by interaction between Nagle&＃8217;s Algorithm and Delayed ACK。

…

希望本文能让大家在使用Memcached的过程中少走一些弯路。相对于Memcached，其实我更喜欢Redis，从功能上看，Redis可以说是Memcached的超集，不过Memcached自有它存在的价值，即便已呈颓势，但是：老兵永远不死，只是慢慢凋零。

原文地址：Memcached二三事儿, 感谢原作者分享。

推荐阅读

ip
一些程序员值得看的电子书

https:github.comguanhui07…自取上传到这里《PHP7内核剖析》深入理解PHP最佳良品《鸟哥的Linux私房菜》可能有点历史久远了，《ModernPHP(中文 ... [详细]

蜡笔小新 2023-10-12 19:26:45
ip
缓存分布式锁 Redis

分布式锁现在Redis基本上没家公司都在使用，只是各自使用的场景不以，但Redis最出名的还是做为缓存服务器，提搞服务器的的吞吐量，下面我们来围绕这个作为缓存做一个总结今天的目标其 ... [详细]

蜡笔小新 2023-10-17 11:51:10
ip
OAuth2.0指南

引言OAuth2.0是一种应用之间彼此访问数据的开源授权协议。比如，一个游戏应用可以访问Facebook的用户数据，或者一个基于地理的应用可以访问Foursquare的用户数据等。 ... [详细]

蜡笔小新 2023-10-17 11:24:37
process
【转】腾讯分析系统架构解析

TA（TencentAnalytics，腾讯分析）是一款面向第三方站长的免费网站分析系统，在数据稳定性、及时性方面广受站长好评，其秒级的实时数据更新频率也获得业界的认可。本文将从实 ... [详细]

蜡笔小新 2023-10-16 19:05:20
ip
未来五年内，Python的普及程度是否会超过JavaScript？

JavaScript和Python是用于构建各种应用程序的两种有影响力的编程语言。尽管JavaScript多年来一直是占主导地位的编程语言，但Python的迅猛发展有 ... [详细]

蜡笔小新 2023-10-16 18:30:05
scala
百度高级架构师马如悦分享：我对Hadoop2.0的见解与经验

当计算任务越来越多，作业提交越来越多，企业普通的做法是，在原有的系统架构上，不停地往上堆积硬件或者加服务器。的确，hadoop设计上的优秀和可扩展性可以方便的 ... [详细]

蜡笔小新 2023-10-14 12:19:48
hash
开发笔记:Memcached高性能内存对象缓存系统

篇首语：本文由编程笔记#小编为大家整理，主要介绍了Memcached高性能内存对象缓存系统相关的知识，希望对你有一定的参考价值。一、Memcached概述 ... [详细]

蜡笔小新 2023-10-13 19:08:11
hash
内存交换机制

相对于内存来说,磁盘的容量是非常大的,所以Linux内核实现了一个叫内存交换的功能--把某些进程的一些暂时用不到的内存页保存到磁盘中,然后把物理内存页分配给更紧急的用户使用,当 ... [详细]

蜡笔小新 2023-10-12 19:20:04
hash
Hadoop——你不得不了解的大数据工具

如今ApacheHadoop已成为大数据行业发展背后的驱动力。Hive和Pig等技术也经常被提到，但是他们都有什么功能，为什么会需要奇怪的名字（如Oozie，ZooKeeper、Flume） ... [详细]

蜡笔小新 2023-10-12 16:12:22
string
2021最新总结网易/腾讯/CVTE/字节面经分享（附答案解析）

本文分享作者在2021年面试网易、腾讯、CVTE和字节等大型互联网企业的经历和问题，包括稳定性设计、数据库优化、分布式锁的设计等内容。同时提供了大厂最新面试真题笔记，并附带答案解析。 ... [详细]

蜡笔小新 2023-12-09 19:11:31
string
PHP算法使用__call优化代码

__call是找不到方法的时候会执行可以代替下面的saddsrem方法publicfunction__call($name,$arguments){if(count($argum ... [详细]

蜡笔小新 2023-10-17 20:49:55
md5
基于分布式锁的防止重复请求解决方案

一、前言关于重复请求，指的是我们服务端接收到很短的时间内的多个相同内容的重复请求。而这样的重复请求如果是幂等的（每次请求的结果都相同，如查 ... [详细]

蜡笔小新 2023-10-17 18:06:55
ip
数据库基本介绍

1、数据库基本知识概念：数据库：database（DB），是一种存储数据的仓库数据库是根据数据结构组织、存储和 ... [详细]

蜡笔小新 2023-10-14 19:23:49
ip
mongoDB介绍、安装、搭建简单的mongoDB服务器（一）

相关网站1. http:www.mongodb.org 官网，可以下载安装程序，和doc，和驱动等。2. http:www.mongoing.com 国内官方网站，博客，问 ... [详细]

蜡笔小新 2023-10-12 20:36:33
ip
TcaplusDB搬迁设备的简单介绍

由于设备升级、机器故障等原因，服务器使用中可能会出现需要搬迁的情况，TcaplusDB可以搬迁存储、接入、Tcapdb设备，操作如下：1.功能入口：2.Tcaplus以下三种进程支 ... [详细]

蜡笔小新 2023-10-12 19:18:00

哈哈哈阿笑

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章